Zendoric
← Volver al día · 29 de julio de 2026

¿Qué es el razonamiento latente? Cómo la IA puede pensar sin palabras

🕒 Publicado en Zendoric: 29 de julio de 2026 · 00:34

El editorial de esta edición de FOD (Turing Post) plantea una pregunta de fondo sobre los modelos de razonamiento actuales: ¿por qué una máquina tiene que pensar en lenguaje?

🎧 Escuchar el análisis

Por Turing Post · 27 de julio de 2026.

El editorial de esta edición de FOD (Turing Post) plantea una pregunta de fondo sobre los modelos de razonamiento actuales: ¿por qué una máquina tiene que pensar en lenguaje? Según el correo, los modelos de razonamiento gastan hoy miles de tokens resolviendo problemas difíciles en forma de texto, incluso cuando nadie llega a leer ese texto generado. Un grupo creciente de investigadores propone sustituir esas cadenas de tokens por estados ocultos continuos, capaces de contener más información y de explorar varias direcciones de razonamiento a la vez. El correo señala que este cambio podría reducir los costes de inferencia y mejorar la planificación, pero también haría el razonamiento del modelo mucho más difícil de inspeccionar.

El artículo arranca recordando cómo se popularizó el Chain-of-Thought (CoT): los modelos aprendieron a producir rastros de razonamiento cada vez más largos, el aprendizaje por refuerzo premiaba las cadenas que llevaban a respuestas correctas, y los sistemas de inferencia empezaron a reservar miles de "thinking tokens" antes de devolver una respuesta. Los resultados fueron notables en matemáticas, programación y planificación, pero los modelos se volvieron más lentos y bastante más caros. El texto lo resume con ironía: "enseñamos a las máquinas a razonar escribiendo ensayos que nadie leería jamás", y ese gasto se volvió económicamente viable ($$).

Al mismo tiempo, según el correo, se generalizó la costumbre de leer esos "ensayos": evaluadores, equipos de seguridad y toda una práctica de supervisión se construyeron sobre la idea de que el razonamiento de un modelo es un documento inspeccionable. El autor matiza que esto fue un efecto secundario: el Chain-of-Thought nació simplemente como una forma de dar más cómputo a un modelo de lenguaje, no como una ventana deliberada a su interior. El único espacio de trabajo de un predictor de tokens es la secuencia de tokens, así que ese "cuaderno de borrador" resultó estar escrito en inglés por accidente de diseño, no por intención.

La sección "Language was useful scaffolding" explica por qué el lenguaje ha sido un andamiaje útil pero limitado. Los modelos generan un token cada vez, y cada token pasa a formar parte del contexto para el siguiente, lo que convierte al texto en un espacio de trabajo cómodo: permite descomponer un problema en pasos, preservar resultados intermedios, detectar errores y reintentar. Pero el lenguaje natural, recuerda el correo, se diseñó para la comunicación entre humanos, no para el cómputo interno de una red neuronal. Cada palabra obliga al modelo a tomar una decisión discreta: un estado interno rico, que podría contener varias interpretaciones posibles, debe colapsar en un único token ("por lo tanto", "siete", "izquierda", "falso"), y el razonamiento posterior parte de ese compromiso ya tomado. Además, el lenguaje añade gasto en forma de transiciones, repeticiones, gramática y frases de relleno tipo "analicemos esto con cuidado", que consumen tokens sin necesariamente hacer avanzar la solución. El correo compara esto con un motor de ajedrez o con AlphaGo, que no necesitan redactar un párrafo explicando cada jugada que consideran, mientras que muchos sistemas de razonamiento actuales sí lo hacen en la práctica.

El correo incluye una tabla comparativa entre Chain-of-Thought y razonamiento latente, con estas diferencias: el medio de razonamiento pasa de tokens de lenguaje discretos a representaciones ocultas continuas; el cómputo pasa de pasos textuales secuenciales a actualizaciones iterativas dentro del modelo; los caminos posibles pasan de comprometerse normalmente con una única ruta escrita a poder preservar varias posibilidades simultáneas; el coste de inferencia, que en CoT crece con la longitud de los tokens de razonamiento, en el razonamiento latente puede requerir menos pasos de decodificación; el entrenamiento, que en CoT funciona de forma natural con RL a nivel de token, en el razonamiento latente requiere nuevos objetivos y políticas de entrenamiento; y la visibilidad, que en CoT es parcialmente legible (aunque no siempre fiel), en el razonamiento latente es difícil de interpretar directamente. La distinción más importante, según el texto, es que el razonamiento latente separa el cómputo de la comunicación: el modelo puede trabajar en su espacio representacional nativo y volver al lenguaje solo cuando está listo para responder.

La sección "From chains of words to continuous thought" repasa los trabajos que hicieron legible esta idea. Menciona que antes hubo intentos previos —tokens de pausa, tokens de relleno, Chain-of-Thought implícito por destilación— pero que **Coconut** (Chain of Continuous Thought), de Meta, fue la demostración más clara: en lugar de decodificar un estado oculto en un token, Coconut retroalimenta ese estado directamente al modelo. Un token representa una única dirección elegida; un estado continuo puede preservar una mezcla de direcciones posibles. El correo indica que en algunas tareas de planificación, Coconut mostró un comportamiento parecido a una búsqueda en anchura (breadth-first search), considerando varias posibilidades antes de comprometerse con una.

Otro trabajo citado es **Soft Thinking**, que crea "tokens de concepto" intermedios combinando varios embeddings de tokens en lugar de seleccionar una sola palabra. Según el correo, los investigadores reportaron mejoras de precisión modestas, de hasta 2,48 puntos en pass@1, junto con una reducción del uso de tokens de hasta un 22,4%; el propio correo aclara que esas dos cifras destacadas provienen de modelos distintos, algo que conviene tener presente antes de citarlas. El texto añade un matiz relevante: los autores de Soft Thinking afirman que sus salidas siguen siendo legibles, porque una mezcla de embeddings ponderada por probabilidad puede proyectarse de nuevo en texto, algo que Coconut no ofrece, ya que un estado oculto no es una frase a la que simplemente se le haya quitado la puntuación. De ahí que el correo concluya que el razonamiento latente no es una sola cosa: una rama "suaviza" el flujo de tokens y conserva algo inspeccionable, mientras que la otra rama abandona por completo el flujo de tokens, y ambas no cuestan lo mismo en términos de pérdida de visibilidad.

El correo menciona además, sin entrar en detalle, otros proyectos que usan bucles recurrentes, refinamiento estilo difusión, estados de razonamiento comprimidos o pequeñas redes que revisan repetidamente su respuesta, señalando con humor que la terminología ya está saturada (continuous thought, soft thought, latent chains, implicit reasoning, recurrent depth, abstract Chain-of-Thought), como si la investigación en IA hubiera vuelto a descubrir "el mismo continente bajo doce banderas distintas". Pese a ello, el autor sostiene que la tendencia de fondo es coherente: el razonamiento está empezando a separarse de la generación de texto.

La sección "Reinforcement learning was the wall" plantea que el razonamiento latente ha tenido una desventaja seria: el razonamiento explícito encaja de forma natural con el aprendizaje por refuerzo porque el modelo produce tokens, cada uno con una probabilidad asociada, lo que permite comparar trayectorias y actualizar la política con métodos como PPO o GRPO. Los estados ocultos continuos, en cambio, no ofrecen esa misma interfaz limpia: son representaciones, y resulta más difícil asignar probabilidades a las transiciones o determinar cuándo el modelo debería dejar de "pensar". El correo indica que los últimos meses han supuesto un esfuerzo concertado por resolver este problema.

Como contexto del sector, cabe recordar que Turing Post es un boletín centrado en investigación y tendencias de IA que suele dedicar ediciones enteras (como esta, parte de su serie "FOD") a explicar en profundidad un único concepto técnico, en este caso el razonamiento latente frente al Chain-of-Thought explícito.

🔗 Relacionadas en Zendoric

Fuentes y referencias