Zendoric
← Volver al día · 4 de septiembre de 2026

El fin de los benchmarks: por qué GPT-6 Astra hace ilegible a los leaderboards

🕒 Publicado en Zendoric: 4 de septiembre de 2026 · 09:12

✨ Generado con IA · cómo se hace

OpenAI lo hizo oficial esta semana: la compañía presenta GPT-6 Astra como la entrada en la 'Era de la AGI', vendiéndolo como un salto generacional con grandes avances en uso de ordenador, programación, investigación y en el tipo de trabajo largo y desordenado que hasta ahora requería supervisión humana constante.

Por AI Secret (Magna & Ben) · 3 de septiembre de 2026.

OpenAI lo hizo oficial esta semana: la compañía presenta GPT-6 Astra como la entrada en la 'Era de la AGI', vendiéndolo como un salto generacional con grandes avances en uso de ordenador, programación, investigación y en el tipo de trabajo largo y desordenado que hasta ahora requería supervisión humana constante. Los autores del newsletter toman ese marketing como punto de partida para plantear una pregunta que, dicen, la industria lleva tiempo esquivando: ¿cómo se mide realmente esto?

Según el artículo, la IA lleva años funcionando a base de benchmarks: cada lanzamiento llega con una tabla que demuestra que el nuevo modelo es un 3% mejor aquí, un 7% mejor allá, y misteriosamente un 12% más listo según un benchmark que no existía la primavera anterior. Se ordenan modelos, se colorean tablas, se apilan leaderboards y se corona un ganador. El texto sostiene que ese sistema funcionaba razonablemente bien cuando los modelos básicamente respondían preguntas, pero deja de funcionar en cuanto los modelos empiezan a *hacer* cosas.

El argumento central es que un benchmark no es más que un banco de preguntas: se le da al modelo un problema, produce una respuesta, y se compara con una clave de corrección. Incluso los benchmarks más sofisticados de 'uso de ordenador', señalan los autores, son en el fondo un conjunto de tareas preescritas ejecutándose dentro de entornos también preconstruidos. Eso es útil, pero no se parece en nada a lo que ocurre cuando se suelta a un agente en una máquina real y se le pide que resuelva algo, porque la vida real no viene con un archivo de benchmark: nada en un escritorio real indica exactamente qué aspecto tiene 'terminado'. Un ordenador real es un navegador que se cuelga a mitad de tarea, un sitio web rediseñado el día anterior sin avisar, una hoja de cálculo con tres versiones contradictorias, un permiso que nadie mencionó, un PDF enterrado seis carpetas más abajo, una API que da timeout justo en la peor petición, y una persona que dice 'ocúpate de esto' y se va sin definir qué es 'esto'. El agente tiene que averiguarlo, y la parte que casi ningún benchmark mide bien es su capacidad de recuperarse cuando el primer intento falla, una habilidad completamente distinta a la de acertar una respuesta.

Por eso, según el artículo, cobran más sentido las informaciones sobre que OpenAI habría comprado decenas de miles de Mac de consumo para entrenamiento de aprendizaje por refuerzo y uso de ordenador. Los propios autores matizan que esas cifras concretas han sido reportadas, no auditadas, pero afirman que la dirección de fondo es inequívoca: los grandes laboratorios de IA quieren a sus modelos operando en máquinas reales, no encerrados en una ventana de chat, y eso rompe silenciosamente el juego de los benchmarks tal y como existía.

El newsletter ilustra el problema con un ejemplo: dos agentes, el mismo ordenador, el mismo encargo vago —'investiga este mercado, elige tres empresas prometedoras, construye una comparativa financiera y prepara una presentación para el comité de inversión'—. No hay una única forma correcta de hacerlo, hay cientos. Un agente navega durante dos horas, otro escribe un script, un tercero tropieza con una fuente de datos mejor a mitad de camino y descarta su plan original, un cuarto comete un error, lo detecta y lo corrige, y un quinto entrega una presentación vistosa construida sobre cifras completamente erróneas. El autor del benchmark no puede escribir de antemano cuál es la respuesta correcta, porque no existe una sola.

Según los autores, esto plantea una incomodidad genuina: la parte más difícil de evaluar a un agente puede haber dejado de ser '¿la respuesta fue correcta?' para convertirse en '¿ha sido esto realmente útil?'. Para defender que no es un matiz menor, ponen el ejemplo de un agente que supera el 95% de un benchmark de uso de ordenador y que, al desplegarlo una semana en una empresa real, construye una estructura de carpetas equivocada, sobrescribe una hoja de cálculo en producción, pierde seis horas siguiendo una pista muerta, cita con total confianza una estadística de 2023 y se atasca ante un muro de permisos que nunca se le ocurre preguntar cómo sortear: en cada tarea del benchmark saca nota perfecta, pero nadie lo mantendría contratado una segunda semana. En cambio, un agente que solo puntúa un 85% pero que sabe cuándo está confundido, hace la única pregunta que le desbloquea, cambia de estrategia cuando algo se rompe y entrega trabajo aprovechable, resulta más difícil de valorar con un leaderboard, que simplemente no tiene forma de captar esa diferencia.

Los autores sostienen que los benchmarks independientes están chocando con un muro no por falta de esfuerzo de los investigadores —que construyen pruebas cada vez más difíciles y realistas—, sino porque la realidad sigue siendo más grande que cualquier test: se puede alargar el benchmark, añadir más herramientas, más sitios, más aplicaciones, más pasos, más aleatoriedad, y no cambia nada de fondo, porque sigue siendo un juego con reglas y, en cuanto un modelo aprende a jugarlo, se vuelve a la casilla de salida. El resultado, dicen, es que seguiremos viendo puntuaciones como 91,4%, 94,7%, 97,2% o 98,1%, que la gente discutirá si el Modelo A supera al Modelo B, que alguien lanzará otro leaderboard y otro más para clasificar a los leaderboards, mientras el modelo real sigue haciendo, en un ordenador de verdad, cosas que ninguna de esas cifras describe. Formulan esto como la 'paradoja del benchmark': cuanto más se acerca la IA a una inteligencia de propósito general, menos dice sobre ella un banco de preguntas preescritas.

Como propuesta de salida, el artículo no plantea 'un benchmark mejor', sino algo distinto de raíz: dejar de darle al agente una pregunta y darle un objetivo; dejar de ofrecerle un entorno controlado y darle uno desordenado; dejar de puntuar si siguió los pasos esperados y puntuar si logró el resultado; dejar de repetir el mismo test público y lanzarlo a entornos que cambian constantemente, con tareas privadas que nunca ha visto; y dejar de preguntar solo si tuvo éxito, para preguntar también con qué fiabilidad lo consigue, qué costó, cuánto tardó, cuántas veces necesitó a un humano, con qué seguridad se comportó y si el trabajo sobrevivió al contacto con la realidad. La fórmula que proponen: la próxima generación de evaluación de IA debería parecerse menos a un examen y más a unas prácticas profesionales —no preguntar si el modelo aprobó el test, sino darle un portátil, una cuenta, un presupuesto, un objetivo y una semana, y observar qué hace—. Los autores reconocen que eso diría mucho más sobre la inteligencia real del sistema, aunque admiten que sería una pesadilla de estandarizar, y cierran con la idea de que, al mismo tiempo que la 'Era de la AGI', empieza la 'Era de la IA no puntuable'.

🔗 Relacionadas en Zendoric