Microsoft dice que sus modelos propios cuestan hasta un 89% menos que OpenAI — y tiene los datos de producción para demostrarlo

MAI-Image-2.5-Pro y MAI-Voice-2-Flash prometen reducciones de coste de GPU del 84% y 89% frente a OpenAI. Satya Nadella publica su 'Frontier Diffusion Manifesto'.

Microsoft ha presentado esta semana dos nuevos modelos propios — MAI-Image-2.5-Pro y MAI-Voice-2-Flash — con unos datos de producción que supuran una única idea: la era de pagar precios de frontera por capacidades que ya no son de frontera ha terminado.

En PowerPoint, MAI-Image-2.5 reduce los costes de GPU hasta un 84% frente a GPT-Image-2 de OpenAI. En Dynamics 365 Contact Center (el sistema usado por T-Mobile o EasyJet), MAI-Voice-2-Flash削减 los costes de GPU hasta un 89%. En OneDrive, el mismo modelo logra un 26% más de tasa de guardado de imágenes editadas, un 25% menos de latencia P95 y 2,5 veces más eficiencia bajo cargas medias de producción.

Son números queMicrosoft no habría publicado hace dieciocho meses. No por modestia, sino porque no existían.

MAI-Image-2.5-Pro: generación de imagen de alta fidelidad

El modelo de imagen alcanza el nivel más alto en renderizado de texto dentro de la imagen —historicamente el punto débil de los generadores— y compite directamente con GPT-Image-2 en edición de imágenes complejas. WPP, el gigante publicitario, ya lo ha incluido en su flujo de trabajo creativo y lo califica como "un salto adelante sólido".

Los precios publicados por Microsoft dan una pista sobre su estrategia:

$5 por millón de tokens de texto de entrada

$8 por millón de tokens de imagen de entrada

$106 por millón de tokens de imagen de salida

En Azure, el modelo está disponible para desarrolladores que quieranintegrarlo en sus pipelines de contenido visual. No es un modelo de investigación; es infraestructura.

MAI-Voice-2-Flash: velocidad, coste y el mercado que importa

Donde MAI-Image-2.5 va por fidelidad, MAI-Voice-2-Flash va por eficiencia. Es el modelo de voz más barato de la familia MAI: $15 por millón de caracteres, un 32% más barato que MAI-Voice-2 y el doble de rápido. El caso de uso no es glamour: centros de llamadas, agentes de voz en tiempo real, aplicaciones donde el coste por llamada y la latencia importan más que la expresividad.

El más sorprendente es Dragon Copilot, usado por 170.000 profesionales médicos y responsable de 28 millones de encuentros con pacientes solo el último trimestre. Ahora funciona con MAI-Transcribe-1.5 para transcripción multilingüe en 58 idiomas. Microsoft dice que las tasas de error en transcripción e identificación de idioma se han reducido un 50% en la mayoría de idiomas.

"Frontier Diffusion": el manifiesto de Nadella

La reacción más interesante llegó de Satya Nadella. En un post en X titulado "Frontier Diffusion & Control", el CEO de Microsoft Articuló lo que ya no es una estrategia implícita sino un argumento público:

"Podemos tomar capacidades de frontera saturadas y entregarlas a escala y menor coste a través de modelos optimizados para productos de alto uso, mientras seguimos usando modelos de frontera para necesidades de frontera."

En otras palabras: ¿por qué pagar precios de frontera cuando un usuario solo quiere reformatear una columna de Excel?

Reuters publicó en abril que la licencia exclusiva de Microsoft sobre la tecnología de OpenAI había pasado a ser no exclusiva. El post de Nadella es la interpretación ejecutiva de ese cambio: Microsoft ya no necesita pedir permiso.

El "hill-climbing machine": pequeños modelos que superan a los grandes en tareas concretas

Detrás de los números hay una metodología. Microsoft la llama su "máquina de escalada": un flywheel que conecta datos de producción reales, modelos entrenados dentro de un entorno de uso específico y un harness de producto que captura la señal.

El ejemplo más claro es MAI-Code-1-Flash, lanzado en GitHub Copilot en junio. Microsoft dice que logra un 10% más de tasa de aceptación de código que GPT-5.4 Mini y Claude Haiku 4.5 en VS Code, usando un 10% menos de tokens en mediana. Los desarrolladores lo prefieren: un 6% más probable que vuelva al día siguiente frente a GPT-5.4 Mini, y un 11% más frente a Haiku 4.5.

Lo interesante viene después. Microsoft tomó ese checkpoint y lo reentrenó dentro de un entorno de aprendizaje por refuerzo centrado en Excel. Le enseñó herramientas y flujos de trabajo específicos de hojas de cálculo. El resultado: un modelo comparable a GPT-5.6 en las tareas de Excel más comunes — pero lo suficientemente ligero para correr en GPUs H100 de generación anterior o incluso A100.

Eso es importante por una razón que va más allá de Microsoft. Si un modelo ofrece calidad cercana a la frontera en hardware de dos generaciones atrás, el economics de la IA cambia radicalmente. Las GPUs más nuevas —incluyendo el clúster GB200 que Microsoft ya tiene operativo— se liberan para entrenamiento en lugar de servir Inference a los usuarios.

Qué significa para la industria

El movimiento de Microsoft revela algo que llevaba meses en el aire: la guerra de modelos no se decide en el benchmark sino en el coste por tarea resuelta. Cuando la capacidad que fue frontera hace un año se convierte en commodity, la ventaja competitiva pasa a estar en quién puede desplegar esa capacidad más barato a escala.

Para las empresas que compran IA esto es una buena noticia: los precios bajan. Para las empresas que venden modelos como OpenAI o Anthropic es un recordatorio de que la ventana de diferenciación por capacidad pura se cierra más rápido de lo que nadie anticipaba.

La pregunta ya no es quién tiene el mejor modelo. Es quién puede permitirse usándolo.

Read more