Xiaomi rompe la barrera de los 1.000 tokens/s en un modelo de 1 billón de parámetros — sin hardware especializado

Xiaomi rompe la barrera de los 1.000 tokens por segundo en un modelo de un billón de parámetros — sin hardware especializado. Qué hay detrás del modo UltraSpeed del MiMo-V2.5-Pro.

Xiaomi rompe la barrera de los 1.000 tokens por segundo en un modelo de un billón de parámetros — sin necesidad de hardware especializado. El modo UltraSpeed del MiMo-V2.5-Pro marca un hito en la optimización de inference para modelos de lenguaje grandes en dispositivos convencionales.

El logro llega de la mano de una combinación de técnicas de ingeniería: quantización adaptativa, speculative decoding mejorado y una nueva arquitectura de attention sparsity que reduce drásticamente el coste computacional por token generado. El resultado es que un modelo de un billón de parámetros puede funcionar en tiempo real en hardware de consumo.

Según la compañía, el nuevo sistema permite generar respuestas a velocidad de conversación humana sostenida, incluso en tareas de reasoning complejo. Las pruebas internas muestran latencias por debajo de los 50ms por token en hardware de gama media.

El modo UltraSpeed está disponible a través de la API de Xiaomi para desarrolladores, y la compañía ha publicado los pesos del modelo bajo licencia que permite uso comercial. El anuncio sitúa a Xiaomi como el primer fabricante de smartphones en ofrecer inference de modelo grande a velocidad nativa sin depender de servidores en la nube.

Para el ecosistema de desarrolladores, esto abre la puerta a aplicaciones de IA local en dispositivos móviles que antes requerían conexión a servidores remotos: asistentes de escritura, herramientas de codificación, y agentes de IA que funcionan completamente offline.