📏 estimate-bench

¿Pueden los LLMs predecir cuántos tokens usará su propia respuesta?

⚠️ Prototipo: 14 tareas, una muestra por par (modelo, tarea). Los resultados son indicativos, no definitivos.

Benchmark ejecutado en octubre de 2026 vía OpenRouter, temperatura 0.