NVIDIA abre su manual de 'decodificación especulativa': la carrera de la IA ya se libra en el coste por token

🕒 Publicado en Zendoric: 3 de septiembre de 2026 · 10:20
✨ Generado con IA · cómo se hace
NVIDIA publica cinco reglas de ingeniería para acelerar la inferencia de LLMs con 'decodificación especulativa' y un benchmark propio, SPEED-Bench, para medirlo. Detrás del tecnicismo hay una tesis de fondo: la batalla ya no es solo entrenar el modelo más grande, sino servirlo más barato.
Por Zendoric · 3 de septiembre de 2026.
NVIDIA ha publicado la tercera entrega de su serie técnica sobre "co-diseño" de modelos de IA, esta vez centrada en la decodificación especulativa (speculative decoding), una técnica para acelerar la fase más lenta de la inferencia en los grandes modelos de lenguaje (LLM). El equipo, liderado por la ingeniera Tiyasa Mitra, propone cinco reglas prácticas para elegir cuántos tokens "adivinar" por iteración y con qué mecanismo, además de un benchmark propio, SPEED-Bench, para medir su eficacia en tareas como programación o resumen. El código de entrenamiento, según la propia NVIDIA, ya está disponible en el repositorio NVIDIA/Model-Optimizer, con ejemplos sobre su modelo Nemotron 3.5 Lightning.
La idea de fondo es sencilla de explicar aunque la ejecución no lo sea: un modelo pequeño "borrador" (draft) propone varios tokens (las unidades mínimas de texto que procesa un LLM) por adelantado, y el modelo grande "objetivo" (target) los verifica todos de un solo golpe, en paralelo, en lugar de generarlos uno a uno. El resultado final es idéntico al que se obtendría generando token a token —solo se conservan los tokens que el objetivo acepta—, pero en menos pasos y, por tanto, más rápido. La clave técnica que aporta este post es cuántos tokens conviene proponer de golpe (la "longitud de borrador", D) según el tamaño de lote, la arquitectura de atención del modelo y el punto de la curva de rendimiento en el que se opera, y cómo elegir entre media docena de mecanismos de borrador —desde modelos externos independientes hasta técnicas integradas como EAGLE-3, MTP, DFlash o DSpark— con costes de entrenamiento que van de un puñado de miles de millones de tokens a más de un billón.
Este tipo de optimización importa más de lo que su apariencia de manual de ingeniería sugiere. Según explica el propio artículo, los modelos de mezcla de expertos (MoE, arquitecturas que activan solo una fracción de sus parámetros por consulta) son cada vez más dispersos y los contextos que manejan cada vez más largos, lo que reduce la concurrencia efectiva por experto. Cualquier técnica que exprima más rendimiento de la misma GPU sin tocar la calidad de las respuestas se traduce directamente en menor coste de servir esos modelos a millones de usuarios. No es casualidad que sea NVIDIA quien publique esto: además de vender los chips, la compañía está consolidando su capa de software (TensorRT-LLM, Model-Optimizer) como el estándar de facto para exprimirlos, lo que refuerza su posición central en toda la cadena de valor de la IA frente a alternativas de hardware o frameworks rivales.
Nuestra lectura es que piezas como esta son el termómetro menos vistoso pero más determinante de hacia dónde va la industria. Mientras el debate público se centra en qué modelo es "más listo", la disputa real por los márgenes se libra en cuántos céntimos cuesta cada token generado, y ese coste marginal es exactamente el mecanismo por el que la IA se abarata y se vuelve accesible a más gente y más casos de uso: cada mejora de este tipo empuja, un poco más, hacia el escenario de abundancia computacional que defendemos como horizonte de largo plazo. A corto plazo, sin embargo, conviene no perder de vista que estas ganancias de eficiencia las capturan primero quienes ya tienen el músculo de ingeniería para implementarlas —los grandes laboratorios y las nubes hiperescala—, lo que amplía, al menos temporalmente, la distancia con quien no puede permitirse ese nivel de optimización a medida.
🔗 Relacionadas en Zendoric
- Europa no necesita ganar la carrera del chatbot, sino la de la autonomía: la apuesta de Domyn · 2026-06-27
- Anthropic busca su propio chip: la carrera por no depender de Nvidia llega a otro gran laboratorio de IA · 2026-07-03
- MiTAC exhibe en WAIC lo que de verdad frena la IA agéntica: no son los chips, es la refrigeración · 2026-07-18


