Transferencia de KV cache entre modelos: el atajo de 278ms que Nvidia ha encontrado para evitar el prefill completo
Nvidia publica una técnica para transferir la memoria de trabajo (KV cache) entre modelos de la misma familia sin recomputar todo desde cero. Usa regresión lineal simple y es hasta 25 veces más rápida.