Cómo la IA 'adivina' antes de pensar: Speculative Decoding explicado
Los LLMs generan texto palabra a palabra, en serie. Speculative decoding introduce un segundo modelo que adivina y uno grande que verifica. El resultado: hasta 4x más rápido sin cambiar el resultado.