Microsoft lanza modelos de IA propios que dice recortar costes hasta un 89% frente a OpenAI

🕒 Publicado en Zendoric: 28 de julio de 2026 · 00:38
Microsoft AI presentó el miércoles 23 de julio de 2026 dos nuevos modelos desarrollados internamente y los puso en vista previa pública: MAI-Image-2.5-Pro, su generador de imágenes de mayor fidelidad hasta la fecha, y MAI-Voice-2-Flash, un modelo de voz pensado para cargas de trabajo empresariales de alto volumen.
Microsoft AI presentó el miércoles 23 de julio de 2026 dos nuevos modelos desarrollados internamente y los puso en vista previa pública: MAI-Image-2.5-Pro, su generador de imágenes de mayor fidelidad hasta la fecha, y MAI-Voice-2-Flash, un modelo de voz pensado para cargas de trabajo empresariales de alto volumen. El anuncio, firmado por el equipo Superintelligence de Microsoft AI, llega aproximadamente un año después de que la compañía se comprometiera a construir modelos propios «a medida», y viene acompañado de un nivel de detalle inusual sobre dónde ya están funcionando: Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot y Azure. El mensaje, dirigido tanto a clientes empresariales como, de forma implícita, a OpenAI, es que estos modelos caseros ya no son proyectos de investigación, sino infraestructura de producción que sirve a millones de usuarios. Como resume la propia empresa en su blog: «Cada una de estas mejoras es un paso hacia el mismo objetivo: productos de Microsoft, impulsados por modelos de Microsoft».
Los dos lanzamientos ocupan extremos opuestos de lo que Microsoft llama la «curva de calidad-velocidad-coste», y esa posición es deliberada. MAI-Image-2.5-Pro apunta al segmento premium: imágenes de gran impacto visual, edición detallada y una renderización precisa de texto dentro de la imagen, un punto débil histórico de los generadores de imágenes. Microsoft fijó su precio en 5 dólares por millón de tokens de texto de entrada, 8 dólares por millón de tokens de imagen de entrada y 106 dólares por millón de tokens de imagen de salida. El modelo base, MAI-Image-2.5, se había situado recientemente en el puesto número 2 en edición de imágenes en Arena, el ranking comunitario que funciona como marcador de referencia de facto en IA generativa multimedia. La industria creativa parece estar tomando nota: Rob Reilly, director creativo global de la agencia de publicidad WPP, calificó el modelo Pro como «un salto adelante importante para las herramientas de GenMedia», añadiendo que «Microsoft se ha consolidado firmemente entre los líderes de la IA generativa».
MAI-Voice-2-Flash va en la dirección contraria. Presentado por primera vez en la conferencia Build de Microsoft, Flash funciona al doble de velocidad que MAI-Voice-2 y cuesta un 32% menos, con un precio de 15 dólares por millón de caracteres. Está diseñado para el mercado, poco vistoso pero enorme, de la voz de alto volumen: centros de llamadas, agentes de voz y aplicaciones de habla en tiempo real, donde la latencia y el coste por llamada importan más que ganancias marginales de expresividad. En conjunto, ambos modelos reflejan una estrategia de construir familias de modelos en lugar de un único modelo insignia, partiendo de la premisa de que un estudio creativo que busca la máxima fidelidad tiene necesidades muy distintas a las de una operación de atención al cliente que gestiona millones de llamadas al día.
Más allá de los lanzamientos en sí, lo más llamativo son las métricas de despliegue que Microsoft ha adjuntado, que se leen como un argumento sistemático a favor de sustituir modelos frontera de terceros en todo su catálogo de productos. Bing Image Creator ya funciona íntegramente sobre MAI-Image-2.5, de principio a fin, la primera vez que esta herramienta de imágenes para consumidores es completamente interna. En PowerPoint, Microsoft afirma que MAI-Image-2.5 reduce los costes de GPU hasta un 84% frente a GPT-Image-2, el modelo de imágenes de OpenAI. En OneDrive, donde MAI-Image-2.5 es ya la opción predeterminada para los escenarios clave de edición de imágenes, la compañía reporta un aumento del 26% en las tasas de guardado, una latencia P95 aproximadamente un 25% menor y una eficiencia 2,5 veces mayor bajo cargas de producción de utilización media.
En el lado de la voz, MAI-Voice-2-Flash impulsa ahora Dynamics 365 Contact Center, la plataforma que usan clientes como T-Mobile y EasyJet, donde Microsoft afirma reducciones de coste de GPU de hasta un 89%. El modelo también está integrado en Azure Voice Live, destinado a desarrolladores que construyen agentes de voz a voz. Quizá el despliegue más relevante se encuentra en el ámbito sanitario: Dragon Copilot, utilizado por 170.000 profesionales médicos y que procesó 28 millones de encuentros con pacientes el último trimestre, funciona ahora con MAI-Transcribe-1.5 para su flujo de trabajo multilingüe en 58 idiomas. Microsoft asegura que sus evaluaciones internas muestran una reducción relativa del 50% tanto en errores de transcripción como de identificación de idioma en la mayoría de las lenguas, una afirmación relevante en un ámbito donde los errores de transcripción pueden trasladarse directamente a las notas clínicas.
En una publicación paralela del mismo día, Microsoft detalló la metodología detrás de estos resultados, a la que llama su «máquina de escalada» (hill-climbing machine): un volante integrado de datos, modelos y el «arnés» de producto que los rodea. El ejemplo más claro es MAI-Code-1-Flash, el modelo de codificación ligero lanzado en GitHub Copilot en junio. Microsoft dice que logra una tasa de aceptación de código aproximadamente un 10% superior a GPT-5.4 Mini y Claude Haiku 4.5 en VS Code, utilizando además un 10% menos de tokens medios. La retención de desarrolladores cuenta una historia similar: los usuarios tenían un 6% más de probabilidad de volver en varios días frente a GPT-5.4 Mini, y un 11% más frente a Claude Haiku 4.5.
Microsoft fue un paso más allá: tomó el checkpoint de MAI-Code-1-Flash y lo siguió entrenando dentro de un entorno de aprendizaje por refuerzo específico de Excel, enseñando a un modelo de codificación las herramientas y flujos de trabajo del conocimiento en hojas de cálculo. El resultado, según la retroalimentación de usuarios en producción, es un modelo a la par de GPT-5.6 en las tareas más habituales de Excel, pero lo bastante pequeño como para funcionar en GPU más antiguas de Nvidia, como las H100 e incluso las A100, en lugar de requerir los aceleradores de última generación. Este detalle de hardware merece subrayarse: todas las grandes compañías de IA compiten por el acceso a los chips más avanzados, y un modelo que ofrece calidad casi de frontera sobre silicio de dos generaciones atrás cambia de forma sustancial la economía del despliegue. Además, libera el hardware más nuevo —incluido el clúster GB200 de Microsoft, ya operativo— para entrenamiento en lugar de para servir tráfico.
El consejero delegado de Microsoft, Satya Nadella, enmarcó los anuncios en una extensa publicación en X titulada «Frontier Diffusion & Control», que funciona casi como un manifiesto estratégico. «Ahora podemos tomar capacidades de frontera ya saturadas y ofrecerlas a escala y a menor coste mediante modelos optimizados para productos de alto uso, mientras seguimos usando modelos de frontera para necesidades de frontera», escribió Nadella, añadiendo que Microsoft está «empezando a enrutar el tráfico a través de nuestras superficies propias hacia MAI siempre que nuestros modelos igualen o superen a las alternativas de frontera». Traducido de la prosa ejecutiva: las capacidades que hace un año eran el estado del arte ahora son básicas, y Microsoft cree que puede replicarlas de forma barata para las tareas específicas y repetitivas que dominan el uso real de sus productos. ¿Por qué pagar precios de frontera por un modelo de frontera cuando un usuario solo quiere reformatear una columna de una hoja de cálculo?
Nadella tuvo cuidado de matizar que «los modelos de frontera de OpenAI y Anthropic forman parte del sistema de orquestación junto a MAI», pero también articuló un principio marcado de independencia de modelo, argumentando que las evaluaciones de la compañía «deben seguir escalando incluso cuando se retire cualquier modelo dado». Mantener el arnés, la memoria, el contexto y las habilidades fuera del modelo, sostuvo, es lo que le da a Microsoft el control. El trasfondo es difícil de pasar por alto: Reuters informó en abril que la licencia exclusiva de Microsoft sobre la tecnología de OpenAI había sido revisada hacia un acuerdo no exclusivo, y The Information reportó en septiembre que Microsoft había empezado a incorporar modelos de Anthropic en algunos productos. El anuncio del miércoles completa el triángulo: Microsoft como orquestador, con los modelos de frontera de sus socios como componentes intercambiables y sus propios modelos absorbiendo una porción cada vez mayor del tráfico rutinario.
La reacción en redes reflejó tanto el atractivo como el escepticismo en torno a la estrategia. «Me encanta cuando la gente usa modelos pequeños para tareas específicas», escribió un usuario de X, @mavihsk, respondiendo a la publicación de Nadella. «¿Por qué tengo que usar el modelo que todo lo sabe solo para cambiar un campo en Excel?». Otro usuario, @nabu_lines, resumió el argumento con precisión: «el coste y el rendimiento mejoran cuando dejas de usar en exceso el modelo más grande». Otros fueron menos indulgentes con el historial de ejecución de Microsoft: el diseñador @designedbyabin escribió que «Microsoft es de lo peor a la hora de escuchar la retroalimentación de los usuarios», argumentando que la compañía «perderá la carrera de la IA porque repetidamente falla en entender las necesidades de los usuarios». Y un usuario, @tokenoverflow, ofreció una crítica más seca sobre el argumento de independencia de modelo: «quiero que siga escalando después de retirar a Microsoft».
El escepticismo tiene fundamento: las métricas que reporta Microsoft —tasas de aceptación, tasas de guardado, ahorros de GPU— provienen de sus propias evaluaciones internas, no de benchmarks independientes, y es la propia compañía quien elige qué comparaciones publicar. Pero la lógica de la estrategia no depende de una sola cifra. El planteamiento de Nadella de que el software tiene ahora «un coste marginal real por primera vez» explica por qué Microsoft está obsesionada con los tokens, las GPU y los costes de servir: cuando las funciones de IA se ejecutan en cada pulsación de tecla a través de un catálogo de productos con mil millones de usuarios, una reducción del 84% en costes de GPU no es una simple optimización, es la diferencia entre un negocio viable y un pozo sin fondo.
La pieza final de la estrategia consiste en vender el propio método, no solo los modelos. Nadella posicionó explícitamente el enfoque de «escalada» como «una plantilla para cualquier otra empresa nativa de IA, de SaaS o empresarial», y Microsoft está empaquetando esa cadena de herramientas a través de Foundry y de lo que llama Frontier Tuning, que permite a las empresas entrenar modelos especializados contra sus propias evaluaciones y entornos de aprendizaje por refuerzo. Eso convierte un ejercicio interno de reducción de costes en un producto de Azure, y da a los clientes empresariales una razón para ejecutar sus cargas de trabajo de IA en la nube de Microsoft aunque los modelos provengan de otro sitio. El énfasis de la compañía en que sus modelos se entrenan «con datos limpios, trazables y de nivel empresarial, sin destilación de modelos de terceros» sirve al mismo fin comercial: en una industria bajo creciente escrutinio por la procedencia de los datos de entrenamiento, Microsoft apuesta a que los compradores empresariales —y los tribunales— se preocuparán por el origen de esas capacidades.
Microsoft dice que ahora está extendiendo el enfoque de escalada a Copilot Chat, Outlook y PowerPoint, y ambos modelos nuevos están disponibles en vista previa pública a través de Microsoft Foundry y de MAI Playground. «Nada de esto es un punto final», escribió la compañía. «Apenas estamos empezando». Hace siete años, Microsoft apostó más de 13.000 millones de dólares a que OpenAI construiría el futuro de la IA. El anuncio de este miércoles sugiere que la compañía ha aprendido desde entonces una lección más barata: el futuro de la IA quizá pertenezca a quien construya la frontera, pero los beneficios pertenecen a quien la vuelve algo ordinario.
🔗 Relacionadas en Zendoric
- OpenAI lanza GPT-5.6 Sol al público tras los retrasos impuestos por la Casa Blanca · 2026-07-10
- Grok 4.5 de SpaceXAI apuesta por la eficiencia: más barato, más rápido y entrenado junto a Cursor · 2026-07-10
- OpenAI lanza GPT-5.6: la familia Sol, Terra y Luna apuesta por la eficiencia y el rendimiento por dólar · 2026-07-11


