Cómo la IA 'adivina' antes de pensar: Speculative Decoding explicado
Los LLMs generan texto palabra a palabra, en serie. Speculative decoding introduce un segundo modelo que adivina y uno grande que verifica. El resultado: hasta 4x más rápido sin cambiar el resultado.
Cuando preguntas algo a ChatGPT, hay un cuello de botella silencioso que determina si la respuesta tarda 2 segundos o 20. No es la calidad del modelo: es cómo genera cada palabra, una a una, en serie. Speculative decoding es la técnica que está cambiando eso — y tiene una idea detrás tan elegante que casi parece magia.
El problema: generación autoregresiva
Los LLMs generan texto token a token. Cada nueva palabra depende de todas las anteriores: para predecir el token 100, el modelo ha procesado los 99 anteriores. Esto es la generación autoregresiva, y es inherentemente secuencial. No puedes predecir el token 50 hasta que hayas predicho el 49. En una respuesta de 500 tokens, son 500 pasos individuales.
En cada paso, el modelo hace una pasada completa por todos sus parámetros — en un modelo de 70.000 millones de parámetros, eso son miles de millones de operaciones. La mayor parte del tiempo no se está 'pensando': está esperando a que termine el cálculo para saber qué palabra viene después.
La idea: un modelo pequeño adivina, uno grande verifica
Speculative decoding introduce dos modelos en lugar de uno. El primero es pequeño y rápido: genera una secuencia de 'suposiciones' — varios tokens consecutivos como si el modelo fuera fluido. El segundo es el modelo grande: verifica todas esas suposiciones en paralelo, de golpe, decide cuáles acepta y cuáles descarta.
Piensa en un equipo donde un junior prepara un borrador rápido y un senior lo revisa. El junior no es tan preciso, pero trabaja a velocidad. El senior es lento y meticuloso, pero puede evaluar 10 páginas en segundos. Juntos, producen más que cualquiera de los dos solos.
Por qué funciona: la distribución del lenguaje
El truco está en que el modelo pequeño y el grande comparten la misma distribución de tokens. Si en el 95% de los casos la siguiente palabra es 'el', ambos modelos coincidirán. El modelo grande solo necesita corregirlos cuando el pequeño se equivoca — que es exactamente donde puede intervenir. En la práctica, si el modelo pequeño tiene razón el 80% de las veces, el modelo grande solo necesita hacer un trabajo adicional en el 20% restante.
El resultado: generar 4 o 8 tokens por el precio computacional de verificar 4 o 8. El modelo grande no tiene que generar en serie — solo validar speculation bundles en paralelo.
Los números que importan
En implementaciones reales, speculative decoding consigue aceleraciones de 2x a 4x sin degradar la calidad de salida. Google lo usa en Gemini. DeepMind lo documentó formalmente en 2022. Pero la versión que realmente lo hizo práctico fue Medusa, de Berkeley: un enfoque donde no hacen falta dos modelos distintos, sino varias 'cabezas de predicción' adicionales entrenadas sobre el mismo modelo base.
Medusa permite que un solo modelo tenga 3-5 especuladores simultáneos, cada uno prediciendo un token a una posición diferente. Si el especulador 1 predice token en posición+1, el especulador 2 en posición+2, y así sucesivamente, el modelo puede aceptar múltiples predicciones a la vez.
Qué significa para tu infraestructura
Si despliegas LLMs en producción, speculative decoding es probablemente la optimización con mejor relación coste/beneficio que existe ahora mismo. No requiere reentrenar el modelo. No cambia el resultado final. Solo necesita que aceptes un pequeño modelo auxiliar ejecutándose en paralelo — algo que ya hacen la mayoría de proveedores de inferencia.
DeepSeek DSpark, que publicó hace unas semanas, mencionaba hasta un 85% de mejora en velocidad de inferencia. Detrás de esa cifra hay técnicas como speculative decoding combinadas con otras optimizaciones de kernel. Pero el principio básico es el mismo que en 2022: haz que un modelo pequeño prepare el trabajo, y deja que el grande lo valide.
La próxima vez que veas que una respuesta de IA parece 'instantánea', recuerda: es posible que detrás haya dos modelos funcionando en equipo — uno adivinando y otro decidiendo si la adivinación merece la pena.