Zendoric
← Volver al día · 27 de julio de 2026

Opus 5 triplica su marca en ARC-AGI hasta el 30%: el salto importa por la pendiente, no por la cifra

🕒 Publicado en Zendoric: 27 de julio de 2026 · 00:21

Anthropic sitúa a Opus 5 en un 30% en ARC-AGI, el triple que su predecesor en apenas dos meses. La cifra sigue siendo baja en absoluto, pero la velocidad de mejora es el dato relevante: el razonamiento abstracto era, hasta hace poco, el muro donde estos modelos se estrellaban.

El hecho, según la información disponible: Opus 5 ha alcanzado un 30% en ARC-AGI, un salto de rendimiento tres veces superior al del modelo anterior en un intervalo de solo dos meses. Aritméticamente, eso implica que la generación previa se movía en el entorno del 10%.

Conviene explicar qué se está midiendo, porque aquí está toda la sustancia. ARC-AGI es un test de razonamiento abstracto: puzzles de patrones deliberadamente novedosos, diseñados para que no se puedan resolver recuperando algo memorizado durante el entrenamiento. Es, por diseño, el benchmark más incómodo para un modelo de lenguaje: premia inferir una regla nunca vista, no recordar una respuesta parecida. Por eso lleva años siendo el contraejemplo favorito de quienes sostienen que estos sistemas solo interpolan.

Nuestra lectura: un 30% no es inteligencia general, y quien lo venda así está haciendo marketing. Sigue siendo una nota baja frente a un humano medio, que resuelve la mayoría de estos puzzles sin esfuerzo consciente. Pero en Zendoric miramos la derivada, no el valor absoluto: triplicar en dos meses en el benchmark expresamente construido para resistir la memorización es exactamente el tipo de señal que separa la mejora cosmética del avance de capacidad. Es coherente con lo que ya veníamos observando en nuestro índice de Calidad, donde Anthropic encabeza la frontera.

La cautela obligada: falta el detalle. No sabemos con qué presupuesto de cómputo por tarea se obtuvo la marca ni bajo qué configuración, y en ARC-AGI ese matiz cambia por completo la interpretación —no es lo mismo un 30% barato que un 30% quemando cómputo sin límite. Hasta que haya verificación independiente, lo tratamos como resultado prometedor, no como hecho establecido. Si la pendiente se mantiene, la conversación de 2027 no será si los modelos razonan, sino cuánto cuesta que lo hagan.

🔗 Relacionadas en Zendoric

Fuentes y referencias