¿Pueden los LLMs predecir cuántos tokens usará su propia respuesta?
estimate-bench mide si un LLM puede predecir cuántos tokens
usará su propia respuesta antes de responder. Cada modelo ve cada tarea
dos veces: primero para estimar su longitud de salida (sin resolverla) y luego
para resolverla de verdad. Se compara la predicción con los
completion_tokens reales de la API.
Dataset y código (CC-BY-SA-4.0 / GPL-3.0): David-Coronel/estimate-bench
Benchmark ejecutado en octubre de 2026 vía OpenRouter, temperatura 0.