Zendoric
← Volver al día · 28 de julio de 2026

Nate pone a prueba los modelos chinos (DeepSeek, Qwen, GLM, Kimi, MiniMax) en un sistema multiagente real

🕒 Publicado en Zendoric: 28 de julio de 2026 · 00:38

El correo aborda el debate sobre si merece la pena mover cargas de trabajo de IA agéntica a modelos chinos (DeepSeek, Qwen, GLM, Kimi, MiniMax) dado que cuestan una fracción del precio de los modelos occidentales de frontera.

Por Nate from Nate's Substack · 27 de julio de 2026.

El correo aborda el debate sobre si merece la pena mover cargas de trabajo de IA agéntica a modelos chinos (DeepSeek, Qwen, GLM, Kimi, MiniMax) dado que cuestan una fracción del precio de los modelos occidentales de frontera. Nate sostiene que la discusión suele reducirse a anécdotas: una buena respuesta de uno de estos modelos hace que se diga que ya han alcanzado a la frontera estadounidense, y un fallo de censura o una cita defectuosa hace que se descarte todo el stack chino de golpe. Según él, ninguno de esos dos extremos responde a la pregunta que de verdad importa, que es si un modelo concreto sirve para un trabajo concreto.

Su postura de partida es que los usuarios serios de IA deberían probar los modelos chinos. Él mismo los usa de forma selectiva -agresivamente en algunos flujos de trabajo-, pero insiste en que el trabajo a realizar, el modelo elegido y la vía de despliegue son tres decisiones separadas que no deben mezclarse.

Nate cuenta que, mientras construía un sistema propio llamado Ringer, probó Qwen como uno de los 'workers' (agentes trabajadores) y le resultó útil, aunque reconoce explícitamente que no conserva un registro completo del checkpoint exacto de Qwen utilizado, la mezcla de tareas, la tasa de aciertos ni el coste de ese experimento en concreto; prefiere admitir esa laguna antes que mezclar experimentos distintos para que el titular suene más redondo. Aclara que el experimento del que sí tiene logs completos -una tanda de 34 tareas en Ringer- se ejecutó con GLM-5.2, GPT-5.5, Grok 4.5 y Composer 2.5 Fast, estos dos últimos a través de la CLI de Grok Build.

El correo funciona como promoción de una guía de pago anunciada previamente en un vídeo, y adelanta su contenido sin desarrollarlo del todo:

- Un análisis de esa tanda de 34 tareas en Ringer que, según Nate, cambió su forma de asignar modelos a tareas: uno de los workers reportó 213 citas textuales verificadas, de las cuales 13 resultaron estar 'cosidas' a partir de fragmentos ('stitched together').

- Una explicación de lo que realmente cuesta un resultado aceptado, proponiendo una métrica alternativa al precio por token, y la idea de que un modelo más barato puede llegar a duplicar el tiempo de revisión humana necesario.

- Recomendaciones sobre por dónde empezar con cada familia de modelos (DeepSeek, Qwen, GLM, Kimi y MiniMax), señalando que hay un fallo específico a vigilar en cada una, aunque el correo no detalla cuáles son esos fallos concretos.

- Un 'kit de bakeoff' compuesto por un validador, un manifiesto, una hoja de puntuación y dos fixtures de prueba pensados para comprobar que el sistema de verificación rechaza efectivamente el trabajo defectuoso.

Nate cierra la introducción señalando que el experimento completo que sustenta estas conclusiones costó aproximadamente 8 dólares. El acceso al contenido completo -el análisis detallado y la guía- está reservado a los suscriptores de pago, que además obtienen membresía a su comunidad de Slack.

🔗 Relacionadas en Zendoric

Fuentes y referencias