Zendoric
← Volver al día · 3 de septiembre de 2026

Estos acertijos hunden a los modelos de IA: ¿los resolverías tú mejor?

🕒 Publicado en Zendoric: 3 de septiembre de 2026 · 10:20

✨ Generado con IA · cómo se hace

Los juegos y los acertijos han acompañado a la inteligencia artificial desde sus orígenes. El propio término "machine learning" se popularizó en 1959 a raíz de un artículo del científico de IBM Arthur Samuel sobre un algoritmo capaz de aprender a jugar a las damas, y el ajedrez o el Go se convirtieron después en…

Los juegos y los acertijos han acompañado a la inteligencia artificial desde sus orígenes. El propio término "machine learning" se popularizó en 1959 a raíz de un artículo del científico de IBM Arthur Samuel sobre un algoritmo capaz de aprender a jugar a las damas, y el ajedrez o el Go se convirtieron después en célebres bancos de pruebas. Un reportaje de Grace Huckins publicado en MIT Technology Review, dentro de su número de septiembre/octubre de 2026, retoma esa tradición para proponer al lector siete pruebas de tipo puzzle con las que comprobar en qué terrenos la IA sigue por detrás del razonamiento humano.

El punto de partida es que, medida solo por su destreza resolviendo acertijos, la IA avanza deprisa. Un equipo de la Universidad de Columbia mostró que a finales de 2024 los mejores modelos apenas acertaban un 18% de los famosos puzles "Connections" del New York Times; para principios de 2025, algunos modelos ya los resolvían casi a la perfección. Pero ese progreso agregado esconde fallos muy concretos y reveladores que el artículo organiza en varios bloques temáticos.

El primero es el razonamiento espacial, ejemplificado con los clásicos problemas de "rotación mental" propios de los test de coeficiente intelectual, en los que hay que determinar si distintas imágenes representan el mismo objeto visto desde ángulos diferentes. Aunque los modelos actuales ya procesan imágenes, siguen fallando de forma llamativa en este tipo de tareas: pese a todo el discurso sobre "modelos de mundo" capaces de entender entornos físicos, los LLM no logran manipular objetos tridimensionales como sí hacen pensadores espaciales entrenados —arquitectos o ingenieros mecánicos—. El texto cita como referencia el estudio "Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models" (2025).

El segundo bloque aborda memoria y capacidad de adaptación a través de los acertijos de "caballeros y bribones", en los que unos personajes dicen siempre la verdad y otros siempre mienten. Un estudio de 2024 de investigadores de Google y la Universidad de Illinois en Urbana-Champaign entrenó y evaluó modelos con variantes ligeras de este puzle clásico, y encontró que cuando una pregunta se parece mucho a otra vista durante el entrenamiento, el modelo tiende a pasar por alto las diferencias clave y responde con lo que memorizó, en lugar de razonar el caso concreto. El artículo apunta que el mismo mecanismo podría explicar el comportamiento de los modelos ante SimpleBench, un conjunto de preguntas diseñadas para parecerse a problemas más complejos que los modelos probablemente vieron en su entrenamiento: los humanos detectan la trampa con facilidad, pero incluso los modelos de última generación se equivocan.

El tercer bloque trata el razonamiento abstracto y visual en dos dimensiones, con el banco de pruebas ARC-AGI como referencia central. Estos problemas piden inferir una regla abstracta y general a partir de unos pocos ejemplos, y los modelos rinden mejor cuando reciben cada cuadrícula no como imagen sino como una cadena de números que codifica el color de cada celda. Según la investigación citada, incluso cuando los modelos aciertan estos puzles suelen hacerlo aplicando reglas enrevesadas y poco generalizables, mientras que los humanos recurren a conceptos visuales simples. Con todo, el artículo reconoce que los modelos han mejorado mucho en ARC-AGI durante el último año, aunque algunos puzles concretos —como el que se incluye en el propio reportaje— todavía los dejan estancados.

Un cuarto apartado da la vuelta al planteamiento: no es solo la IA la que cae en trampas cognitivas, también los humanos tenemos las nuestras, y no todas las compartimos con los modelos. El reportaje describe un conjunto de preguntas de "ronda relámpago" pensadas por psicólogos para invertir el fenómeno de SimpleBench: aquí son las personas las que suelen dar respuestas impulsivas —por errores intuitivos de cálculo o por preguntas formuladas para sugerir una respuesta obvia que se desmorona en cuanto se lee con atención—, mientras que los modelos responden de forma más deliberativa. La referencia académica es el estudio de Hagendorff, Fabi y Kosinski publicado en Nature Computational Science en 2023 sobre sesgos de razonamiento de tipo humano que emergieron en grandes modelos de lenguaje.

El quinto y último bloque de fondo es el de la complejidad creciente. Una investigación de Apple mostró que los LLM resuelven sin problema versiones sencillas de la Torre de Hanói (mover una pila de discos sin colocar nunca uno más grande sobre uno más pequeño) y de los clásicos problemas de cruce de río, pero empiezan a fallar a partir de unos seis discos o seis personas. Aquel estudio de Apple se hizo viral, aunque —recuerda el artículo— también generó debate sobre si realmente revela una limitación propia del razonamiento de los LLM o simplemente refleja que es normal cometer más errores a medida que un problema se complica. En la misma línea, investigadores de la Universidad de Washington, Stanford y el Allen Institute for AI (en el trabajo conocido como ZebraLogic) observaron que los modelos tropiezan de forma parecida con los puzles de "rejilla lógica", en los que hay que deducir los atributos de varias personas a partir de una lista de pistas.

Más allá del formato lúdico, el reportaje deja una lectura de fondo: el contraste entre puntuaciones casi perfectas en bancos de pruebas muy trabajados y tropiezos vergonzosos ante variaciones sutiles de acertijos clásicos sugiere que buena parte del rendimiento de los modelos depende del reconocimiento de patrones memorizados durante el entrenamiento, más que de un razonamiento genuinamente generalizable. Al mismo tiempo, el hecho de que los humanos conservemos sesgos intuitivos que la IA no comparte matiza cualquier relato simplista de "la IA ya piensa mejor que nosotros en todo": cada acertijo, señala la autora, ilumina una forma distinta en que la cognición humana y la de las máquinas divergen, y quien logre resolver todos los ejemplos propuestos podrá decir, al menos por ahora, que superó a la IA en su propio terreno.

🔗 Relacionadas en Zendoric

Fuentes y referencias