GPT-6 Astra y los transformadores en bucle: la arquitectura que reescribe las reglas de la profundidad
GPT-6 Astra usa 'looped transformers': los mismos bloques de pesos se reutilizan varias veces para dar profundidad computacional sin multiplicar parámetros. Te contamos cómo funciona.
Si has seguido las noticias sobre modelos de lenguaje estos últimos meses, seguro que has oído hablar de GPT-6 Astra, el último modelo de OpenAI que está batiendo récords en coding, matemáticas y uso del ordenador. Pero lo más interesante no es solo lo que hace: es cómo lo hace internamente. Y aquí entra un concepto que está dando mucho que hablar: los transformadores en bucle, o looped transformers.
Un concepto que viene de 2018
La idea base de un transformador en bucle no es nueva. Se remonta al paper Universal Transformers de Google Brain, publicado en 2018. La intuición es sencilla: en un transformer convencional, la entrada pasa una sola vez por cada bloque de la pila. Si tienes 24 bloques, la información se procesa exactamente 24 veces, una por bloque.
Un transformador en bucle hace algo diferente: después de la primera pasada completa, los estados ocultos vuelven a entrar por el primer bloque. Y así sucesivamente, pasando por los mismos pesos una y otra vez. Si lo "desenrollamos", un modelo con 22 bloques que hace 2 pasadas tiene 44 aplicaciones de bloque en total, pero sigue usando exactamente los mismos pesos que antes.
Ventajas clave:
Coste de memoria constante: no necesitas almacenar nuevas activaciones para bloques adicionales, solo se recirculan las existentes.
Profundidad efectiva variable: el modelo puede decidir dinámicamente cuántas pasadas necesita para cada token, algo que un transformer profundo convencional no puede hacer.
El ejemplo más claro reciente es el modelo Nanbeige 4.2-3B, un LLM open-weight que aplica 22 bloques transformer dos veces: la entrada pasa por los 22 bloques, recircula, y vuelve a pasar por los mismos 22 bloques. En términos de profundidad computacional, equivale a 44 bloques. En términos de pesos, sigues teniendo 22.
GPT-6 Astra y la "profundidad recurrente"
Según informes de The Information, GPT-6 Astra utiliza una variante de esta idea, lo que OpenAI habría denominado "profundidad recurrente" o recurrent depth. Jensen Huang (CEO de Nvidia) mencionó que Astra se entrenó con aproximadamente 100.000 GPUs Grace Blackwell.
En términos de rendimiento, los números son brutales: Astra alcanza un 99,9% en el benchmark ARC-AGI-3, mientras que GPT-5.6 Sol se quedaba en un 7,8%. En coding agente (Artificial Analysis Coding Agent Index), también lidera la frontera.
Pero hay algo más que ha generado debate: los rumores de que Astra "oculta" su cadena de razonamiento interno.
¿Razonamiento oculto o procesamiento recurrente?
Cuando un modelo de razonamiento como o1 o Claude 3.7 Sonnet piensa en voz alta, suele generar una cadena de pensamiento visible (chain-of-thought) antes de dar la respuesta final. Es útil para transparencia y para depurar. La pregunta que circulaba era: ¿están esos razonamientos "ocultos" en Astra?
La explicación más plausible no es conspiratoria: es arquitectura. En un looped transformer, la información recircula a través de los mismos bloques varias veces antes de emitirse como salida. Eso significa que el modelo puede "refinar" sus representaciones internamente, sin necesidad de exponer pasos intermedios como texto visible. No es que oculte el razonamiento deliberadamente: es que no lo expresa como cadena de texto.
El paralelismo con el cerebro humano es interesante: cuando tú resuelves un problema de matemáticas, no piensas en voz alta cada paso. Algunos cálculos los haces "en la cabeza" internamente y luego escribes el resultado. Los looped transformers permiten algo parecido: procesamiento profundo interno que no necesita manifestarse como texto intermedio.
Implicaciones para la seguridad y la auditoría
Aquí es donde la cosa se pone relevante para la ciberseguridad. Si el razonamiento no es visible, las auditorías externas se complican. No puedes leer la cadena de pensamiento de un modelo para verificar cómo llegó a una conclusión. Esto tiene implicaciones directas para:
Agentes de IA autonomous que toman decisiones sin supervisión humana.
Modelos desplegados en entornos críticos: banca, medicina, infraestructura.
Evaluación de sesgos y alineamiento: sin razonamiento visible, es más difícil detectar dónde falla un modelo.
El problema es análogo a lo que ocurre con el código ofuscado: sabes qué entra y qué sale, pero entender el proceso intermedio es prácticamente imposible. Esto no significa que los looped transformers sean peligrosos por definición; significa que necesitamos nuevos métodos de auditoría que no dependan de leer el razonamiento explícito.
Lo que viene ahora
Sebastian Raschka sugiere que los próximos meses veremos una segunda ola de modelos diseñados específicamente para uso de ordenador: no solo APIs y CLIs, sino interfaces gráficas completas. OpenAI aparentemente compró decenas de miles de Mac Minis y Mac Studios no para entrenar los modelos con GPUs, sino para exponer macOS durante el entrenamiento y que el modelo aprenda a interaccionar con él.
El workflow básico es un ciclo observe-act-learn: el modelo recibe capturas de pantalla del escritorio, predice acciones de ratón y teclado, las ejecuta, recibe nuevas capturas, y recibe señales de éxito o fracaso para ajustar su comportamiento mediante RLVR (Reinforcement Learning with Verifiable Rewards).
Los looped transformers son, en cierto modo, la otra mitad de esta ecuación: por el lado de la inferencia, permiten razonamiento profundo sin texto visible; por el lado del entrenamiento, permiten que modelos tan grandes sean económicos de desplegar y rápidos de ejecutar. Estamos entrando en una fase donde la diferencia entre "usar un modelo" y "tener un colega digital" se reduce a pura cuestión de interfaz.