AMD adquiere Taalas: el chip que graba modelos de IA en silicio y promete ser 48 veces más rápido que Nvidia
AMD compra Taalas, una startup que graba pesos de modelos de IA directamente en el silicio durante la fabricación. El chip HC1 servía Llama 3.1 8B a 16.960 tokens/s — 48 veces más rápido que Nvidia. ¿Qué significa esto para la inferencia, los agentes y la ciberseguridad?
AMD ha adquirido Taalas, una startup canadiense fundada en 2023, por una cifra no publicada. La operación busca plantar cara a Nvidia en el terreno de la inferencia de IA — y el enfoque de Taalas no se parece a nada que exista en el mercado actual.
La diferencia fundamental
Los chips convencionales — GPUs de Nvidia, LPUs de Groq, los aceleradores wafer-scale de Cerebras — siguen siendo arquitecturas de propósito general que cargan los pesos del modelo desde memoria HBM externa cada vez que sirven una inferencia.
Taalas hace algo radicalmente distinto: graba los pesos del modelo directamente en el silicio durante la fabricación del chip. Sus procesadores se componen de dos regiones: el "mask-ROM recall fabric" (donde los pesos se graban como máscaras de fotolitografía en la oblea) y el "SRAM recall fabric" (donde se almacenan KV-caches y adaptadores LoRA). El resultado es que el modelo vive dentro del chip, no encima de él.
Los números presentados en febrero con el chip HC1 (fabricado en TSMC a 6 nm) son difíciles de ignorar:
16.960 tokens/segundo sirviendo Llama 3.1 8B
48 veces más rápido que las GPUs de Nvidia en el momento del anuncio
8,5 veces más rápido que los aceleradores de Cerebras
El precio de esta velocidad
Una vez que el chip está desplegado, estás atado a ese modelo. Cualquier cambio mayor — una nueva versión del modelo, por ejemplo — requiere un "re-spin" del chip. Taalas mitiga esto diciendo que solo hacen falta cambiar dos capas de metal (no el proceso completo), lo cual es más barato y rápido que fabricar desde cero, pero sigue sin ser trivial.
Aún así, la compañía asegura que grabar un modelo en silicio cuesta 100 veces menos que entrenar uno de frontera. Y para modelos que van a permanecer estables durante meses o años — modelos internos de empresas, agentes de código desplegados en producción — el cálculo cambia radicalmente.
AMD + Taalas: la estrategia de pila completa
AMD ha confirmado que pretende combinar sus racks Helios (basados en Instinct) con aceleradores Taalas en una arquitectura disagregada: las GPUs instint se encargan del procesamiento pesado del prompt (el "thinking") y los chips Taalas se dedican exclusivamente a la generación de tokens. El razonamiento en dos fases — donde el modelo "piensa" antes de responder — consume muchos más tokens por consulta, con lo que la velocidad de generación de Taalas se vuelve especialmente relevante.
Para modelos de 20B parámetros por chip (el objetivo del HC2, previsto para este verano), harían falta apenas 50 aceleradores Taalas para servir un modelo de un billón de parámetros. Eso es significativamente más eficiente en espacio y energía que los sistemas LPX de Nvidia, que necesitan decenas de GPUs más 2.000 LPUs de Groq para la misma tarea.
Implicaciones para la ciberseguridad y los agentes de IA
Esta adquisición tiene un componente que va más allá del rendimiento bruto. Los agentes de IA que operan en entornos empresariales — especialmente los que manejan código, infraestructura o datos sensibles — necesitan latencias predecibles y bajas. La generación de tokens 48 veces más rápida que Nvidia cambia el cálculo económico del test-time scaling: si el coste por token baja un orden de magnitud, tiene sentido dejar que un modelo "piense" mucho más antes de actuar.
Para la seguridad, esto es una espada de doble filo. Más tiempo de razonamiento también significa más oportunidades para que un agente detecte y explote vulnerabilidades en tiempo real. La velocidad importaba antes para la experiencia de usuario. Ahora importa para la dinámica de ataque y defensa.
La operación está sujeta a aprobación regulatoria y se espera que cierre en el cuarto trimestre de 2026. OpenAI, Anthropic y Meta ya son clientes importantes de AMD Instinct, lo que sugiere que no sería sorprendente ver modelos como GPT o Claude desplegados sobre esta arquitectura híbrida.