Laguna S 2.1: el modelo de 118B de Poolside que supera a gigantes de billones de parámetros

🕒 Publicado en Zendoric: 30 de julio de 2026 · 00:20
El artículo de esta semana de "AI of the Week" parte de un ejercicio visual sencillo: coger todos los modelos de pesos abiertos que hacen público su número de parámetros, situar el total de parámetros en un eje X logarítmico y la puntuación en Terminal-Bench 2.1 en el eje Y.
Por TheSequence · 29 de julio de 2026.
El artículo de esta semana de "AI of the Week" parte de un ejercicio visual sencillo: coger todos los modelos de pesos abiertos que hacen público su número de parámetros, situar el total de parámetros en un eje X logarítmico y la puntuación en Terminal-Bench 2.1 en el eje Y. El resultado esperado, y el que efectivamente se observa en la mayoría de los casos, es una nube de puntos que sube de izquierda a derecha: cuanto más grande el modelo, mejor la puntuación. Es la relación que la industria ha asumido como norma.
Sin embargo, hay un punto que rompe esa tendencia de forma llamativa: a 118.000 millones de parámetros (118B), muy por encima de la línea de ajuste que siguen el resto de modelos, aparece Laguna S 2.1, con una puntuación del 70,2% en Terminal-Bench 2.1. Para poner esto en perspectiva, el correo compara ese resultado con tres modelos mucho más grandes: DeepSeek-V4-Pro-Max, con 1,6 billones de parámetros, que obtiene 64,0 puntos; Inkling, con 975.000 millones de parámetros, que llega a 63,8; y Nemotron 3 Ultra, con 550.000 millones de parámetros, que se queda en 56,4.
Es decir, un modelo con una fracción del tamaño de sus competidores no solo iguala sino que supera a modelos entre 4,6 y 13,5 veces más grandes que él en este benchmark.
La diferencia se amplifica todavía más en DeepSWE, descrito en el correo como un benchmark más difícil y menos saturado que Terminal-Bench. Ahí, Laguna S 2.1 anota 40,4 puntos frente a los 9,0 de DeepSeek-V4-Pro-Max, una brecha que el propio texto señala como ya no sutil en absoluto: casi 4,5 veces más rendimiento con 13 veces menos parámetros.
El correo subraya que este tipo de resultado —un déficit de parámetros de 13 veces combinado con una ventaja de puntuación de 4 veces— es habitualmente la clase de dato que hace sospechar que el benchmark está mal planteado o manipulado ('alguien rompió el eval'). Según el texto, la compañía detrás de Laguna, Poolside, pareció anticipar esa reacción de escepticismo, y por ello publicó todas las trayectorias de todos los intentos (trials) del conjunto de evaluación final, de modo que cualquiera puede revisar exactamente qué hizo el modelo paso a paso. El artículo señala que esa decisión de transparencia total revela, en sí misma, mucho sobre cómo se diseñó este lanzamiento.
El cuerpo del correo se corta justo cuando comienza a presentar a la compañía responsable, con la frase 'The company you have probably never heard of...' ('la empresa de la que probablemente nunca has oído hablar...'), lo que indica que el resto del análisis —presumiblemente sobre Poolside, su enfoque y más detalles del modelo Laguna— continúa en la versión completa del artículo en Substack, no incluida en el texto recibido por correo.
En general, como contexto del sector, Terminal-Bench y DeepSWE son benchmarks utilizados para medir capacidades de modelos de lenguaje en tareas de terminal/ingeniería de software agéntica, y la comparación de eficiencia (rendimiento por parámetro) es un tema recurrente en la evaluación de modelos abiertos frente a los modelos de gran escala tipo DeepSeek o Nemotron.
🔗 Relacionadas en Zendoric
- OpenAI audita SWE-Bench Pro y halla que ~30% de sus tareas están rotas · 2026-07-16
- Moonshot presenta Kimi K3, el mayor modelo abierto del mundo, y China estrecha la brecha de IA con EE.UU. · 2026-07-18
- Thinking Machines, el laboratorio de Mira Murati, lanza Inkling: un modelo abierto de 975.000 millones de parámetros · 2026-07-17


