El razonamiento como huella: destilar cadenas de pensamiento en modelos pequeños

🕒 Publicado en Zendoric: 22 de julio de 2026 · 01:59
Este número de TheSequence Knowledge retoma un episodio que la propia newsletter describe como uno de los resultados más importantes de destilación de razonamiento de la última década: el caso de DeepSeek R1, en enero de 2025.
Por TheSequence · 21 de julio de 2026.
Este número de TheSequence Knowledge retoma un episodio que la propia newsletter describe como uno de los resultados más importantes de destilación de razonamiento de la última década: el caso de DeepSeek R1, en enero de 2025.
Según el correo, DeepSeek tomó su gran modelo de razonamiento, R1, y lo usó para generar alrededor de 800.000 soluciones resueltas paso a paso: cadenas de pensamiento largas y a veces desordenadas, con falsos comienzos, autocorrecciones y momentos de "espera, déjame reconsiderar". El equipo filtró esas trazas por corrección y legibilidad y, después, aplicó la técnica más sencilla posible sobre ellas: fine-tuning supervisado (SFT) plano sobre modelos abiertos ya existentes, concretamente Qwen en tamaños 1.5B, 7B, 14B y 32B, y Llama en 8B y 70B. El correo subraya explícitamente lo que NO se usó en este proceso: nada de aprendizaje por refuerzo, nada de KL inversa, nada de muestreo on-policy y ningún esquema de "profesor como crítico". Simplemente predicción del siguiente token sobre las transcripciones generadas por el modelo maestro.
El resultado, de acuerdo con el texto, fue sorprendentemente bueno. El modelo destilado de 32B comenzó a resolver problemas de matemáticas de nivel competición que, en palabras del artículo, "no tenía por qué poder resolver". El modelo de 7B, por su parte, empezó a verificar su propio trabajo y a ramificar su razonamiento a mitad de la generación, comportamientos emergentes que nadie entrenó de forma directa. En conjunto, un grupo variado de modelos densos y pequeños pasó a razonar como si fueran, según la expresión del correo, "diez veces más grandes".
Lo interesante del planteamiento —y así lo presenta la propia newsletter— es la aparente contradicción con instalments anteriores de la serie TheSequence. El correo recuerda que en una entrega previa se había argumentado extensamente por qué la imitación ingenua a nivel de secuencia (sequence-level imitation) es la herramienta equivocada para destilar razonamiento, precisamente porque el modelo alumno nunca estará, en el momento de inferencia, sobre las mismas trayectorias que el modelo maestro; de ahí la migración argumental hacia la KL inversa frente a la KL directa. Sin embargo, el resultado de DeepSeek R1 que aquí se describe es, tal cual, imitación ingenua a nivel de secuencia, y funcionó espectacularmente bien.
El texto plantea esta tensión como el verdadero tema del artículo: ni "la imitación funciona" sin matices, ni "la imitación no funciona" sin matices, sino algo más interesante que promete desarrollar a continuación bajo el título "The Trace, Not the Answer" (la traza, no la respuesta), sugiriendo que la clave no está en imitar la respuesta final del maestro, sino en imitar el proceso completo de razonamiento —incluyendo dudas, correcciones y bifurcaciones— como mecanismo de transferencia.
El cuerpo del correo recibido corresponde a la introducción del artículo completo publicado en Substack; el contenido facilitado se corta justo antes de que TheSequence desarrolle en detalle el argumento técnico de por qué la imitación de trazas (a diferencia de la imitación de respuestas) evita el problema de distribución que motivó el giro hacia la KL inversa en entregas anteriores de la serie.
En general, como contexto del sector, la destilación de capacidades de razonamiento desde modelos grandes hacia modelos pequeños mediante fine-tuning sobre cadenas de pensamiento generadas por el propio modelo maestro se ha convertido en una técnica ampliamente discutida desde la publicación de R1 por parte de DeepSeek, dado su bajo coste computacional relativo frente a los enfoques basados en aprendizaje por refuerzo puro.
🔗 Relacionadas en Zendoric


