OpenAI acusa a Moonshot AI de una campaña industrial de destilación: cómo se roba el cerebro de un modelo sin tocar sus servidores
OpenAI publica los detalles de una campaña coordinada (1-28 julio 2026) que intentó extraer el razonamiento protegido de sus modelos. Atribuida a personas vinculadas a Moonshot AI, explota una vulnerabilidad que también afecta a Claude y Gemini. No hubo hackeo: solo ingeniería de prompts.
OpenAI publicó el miércoles un informe técnico en el que detalla cómo identificó y desactivó una campaña coordinada de «destilación adversaria» diseñada para extraer el razonamiento protegido de sus modelos. La actividad, que comenzó el 1 de julio de 2026 y fue completamente interrumpida el 28 de julio, alcanzó un pico de alrededor de 16.000 peticiones en dos días y se apoyó en un clúster de más de 15.000 cuentas asociadas. OpenAI atribuye el «núcleo» de la operación a personas vinculadas a Moonshot AI, el laboratorio chino detrás del modelo Kimi K3.
No es la primera vez que Moonshot aparece en el radar de un laboratorio estadounidense. Anthropic ya acusó el mes pasado a la misma compañía (rastreada internamente como GTG-16002) de enrutar en secreto miles de consultas de usuarios hacia Claude y devolver las respuestas como si fueran suyas, una operación destinada a entrenar su propio modelo de razonamiento con cadenas de pensamiento generadas por el modelo de Anthropic. Pero el informe de OpenAI va un paso más allá: documenta la mecánica interna del ataque, las contramedidas aplicadas y, sobre todo, una vulnerabilidad arquitectónica que comparten los principales modelos frontera del mercado.
Qué es el «razonamiento protegido» y por qué importa
Cuando un modelo moderno trabaja en una tarea difícil — un problema matemático, una consulta legal o una cadena de exploits de ciberseguridad — no entrega solo la respuesta final: mantiene internamente un registro paso a paso de cómo llegó hasta ella. A ese registro se le llama «razonamiento protegido» o «chain-of-thought cifrado». Es, en la práctica, el manual de operaciones interno del modelo: contiene la estrategia que siguió, las herramientas que consideró, los atajos que descartó y, en muchos casos, información sensible que el sistema decidió no mostrar en la salida visible por motivos de seguridad.
Extraer ese razonamiento es mucho más jugoso que copiar respuestas finales. Permite entrenar un modelo nuevo que herede las capacidades del original pero sin los filtros de seguridad que el laboratorio aplicó a la salida. Es, en esencia, robar el know-how de un modelo saltándose la valla de las guardrails, una operación que en el lenguaje de la seguridad informática empieza a tener nombre propio: destilación adversaria.
Cómo lo hicieron: ni hackeo ni exploit, pura manipulación de prompts
Lo más llamativo del caso es el método. OpenAI subraya que los operadores no rompieron ningún cifrado, no comprometieron una base de datos ni accedieron a conversaciones almacenadas. Lo que hicieron fue manipular las interacciones con el modelo para que el razonamiento protegido se reprodujera en formas visibles para el solicitante, violando los términos de servicio pero aprovechando el comportamiento legítimo del sistema.
Entre las técnicas documentadas por OpenAI y por investigadores independientes de MATS Research, ELLIS Institute Tübingen y Synk (arXiv 2608.09867), destacan cuatro vectores principales:
- Reenvío de razonamiento cifrado entre conversaciones: los operadores tomaban un bloque de razonamiento cifrado de una sesión y lo pegaban en otra conversación, pidiendo al modelo que lo «descifrara y transcribiera». Esto funcionaba porque ciertas trazas eran reutilizables entre sesiones y entre usuarios del mismo proveedor.
- Compatibilidad cross-model dentro del mismo ecosistema: el paper de arXiv demostró que las trazas de razonamiento cifrado de Claude, Gemini y GPT son «totalmente compatibles e intercambiables entre sesiones, usuarios y modelos dentro del ecosistema de un mismo proveedor». Forzando a un modelo menos protegido a decodificar la traza de otro más capaz, los atacantes obtenían el razonamiento en texto plano sin necesidad de hacer jailbreak al modelo avanzado.
- Inyección de prompts invisible dentro de bloques cifrados: la misma vulnerabilidad permite esconder payloads maliciosos dentro del razonamiento cifrado, que el modelo víctima ejecuta al procesarlo sin saber que está siendo instruido. Es, en cierto modo, un nuevo vector de prompt injection que viaja cifrado y evade los detectores clásicos.
- Exfiltración de datos sensibles a escala: el razonamiento extraído puede contener datos del usuario, secretos del propio modelo o información que el sistema decidió ocultar. A escala industrial, eso convierte una fuga de razonamiento en una fuga de datos.
La cronología: tres meses de bajo perfil antes del estallido
Según el informe de OpenAI, la campaña arrancó el 1 de julio de 2026 con un volumen bajo, casi indetectable. El 24 y 25 de julio el tráfico se disparó hasta alcanzar 16.000 peticiones usando el patrón de extracción, provenientes de más de 4.000 cuentas. La investigación posterior identificó actividad relacionada en un clúster de más de 15.000 usuarios. El 28 de julio OpenAI había cerrado todas las vías conocidas.
Ese patrón de «rampa lenta, pico corto, apagón» se está volviendo típico en campañas de destilación a gran escala. Permite probar la técnica con pocas cuentas antes de industrializarla, y al mismo tiempo deja un rastro suficientemente disperso como para dificultar la atribución. OpenAI afirma que no presentó evidencia técnica concreta para identificar a Moonshot — «por motivos de seguridad», dice — pero que el patrón de prompts, la infraestructura utilizada y la coordinación temporal encajan con el resto de la inteligencia que maneja.
Atribución: por qué señalan a Moonshot
OpenAI no dice que Moonshot ordenara la campaña. Dice que atribuye el «núcleo» de la actividad a personas asociadas a la compañía, un matiz importante: podría tratarse de empleados a título individual, de un equipo informal, de un contractor externo o de una filial no declarada. Es el mismo lenguaje que Anthropic usó el mes pasado, y encaja con un patrón creciente: las acusaciones se concentran en el ecosistema, no en la empresa formalmente.
Lo que sí aporta OpenAI es contexto operativo. Las cuentas fraudulentas usaron técnicas de evasión distribuidas, los prompts estaban diseñados para revelar la traza de razonamiento cifrado de GPT-5.6 Sol (la versión que Moonshot habría querido destilar), y la ventana temporal coincide con la fase final del entrenamiento de Kimi K3, el modelo que Moonshot presentó como «el mayor sistema open-source del mundo» con 2,8 billones de parámetros.
Los operadores no rompieron nuestro cifrado, ni comprometieron una base de datos, ni accedieron directamente a conversaciones almacenadas. En su lugar, manipularon las interacciones con el modelo para que el razonamiento protegido pudiera reproducirse en formas visibles para el solicitante, de forma coordinada y a escala, violando nuestros términos de servicio. — OpenAI, Disrupting a coordinated model-distillation campaign, 30 de septiembre de 2026
Por qué esto va más allá de una pelea entre laboratorios
Hay tres razones por las que el asunto importa más allá de la rivalidad entre OpenAI, Anthropic y los laboratorios chinos.
La primera es la seguridad nacional. OpenAI fue explícita: «la destilación adversaria plantea riesgos de seguridad y seguridad nacional. El razonamiento extraído podría usarse para entrenar otro modelo sin preservar las salvaguardas aplicadas a la salida visible del modelo original». A escala, eso significa que un actor estatal podría saltarse años de investigación en seguridad de IA simplemente reentrenando un modelo destilado que no tiene por qué heredar los filtros de seguridad. En un mundo donde los modelos frontera empiezan a usarse en ciberoperaciones ofensivas, eso es una vulnerabilidad de primer orden.
La segunda es la propiedad intelectual. Si los modelos frontera son, en la práctica, activos estratégicos, la destilación no autorizada es una forma de espionaje industrial a una escala sin precedentes. Anthropic ya pidió públicamente a los legisladores que limiten el acceso a chips para China precisamente para acotar la capacidad de entrenamiento; ahora se ve que esa barrera se puede saltar por software, sin necesidad de GPUs de última generación.
La tercera es la arquitectura. La vulnerabilidad que documentaron los investigadores independientes — la intercambiabilidad cross-model del razonamiento cifrado dentro del mismo proveedor — es un fallo de diseño que afecta a toda la industria. OpenAI, Anthropic y Google usan variantes de la misma idea (cifrar el chain-of-thought para que no se filtre en la salida), y los tres heredan el mismo problema. El paper de arXiv ya describió cómo un atacante puede «forzar a un modelo más débil y menos protegido a decodificar la traza y emitirla en texto plano, sin necesidad de hacer jailbreak al modelo más capaz directamente».
Qué hizo OpenAI (y qué le queda por hacer)
La respuesta fue de tres niveles. A corto plazo, OpenAI baneó o restringió las cuentas fraudulentas, endureció los controles de signup e infraestructura, y amplió la monitorización para detectar redes relacionadas. A medio plazo, cerró una vía que permitía a alguien con acceso a razonamiento cifrado de otro usuario reproducirlo y recuperar su contenido, y añadió comprobaciones para detectar y retener la salida en streaming que pudiera exponer razonamiento.
A largo plazo, OpenAI ha compartido los hallazgos con el Frontier Model Forum y con los canales apropiados de intercambio de información con gobiernos, lo que en la práctica significa que otros frontera y agencias como AISI (UK), AISI (US) o ENISA están al corriente y pueden buscar patrones equivalentes en sus propios sistemas. Quedan dos frentes abiertos: las implantaciones alojadas por socios (que necesitan las mismas protecciones que los servicios de primer nivel) y los ataques que viajan en salidas de herramientas, que requieren defensas que examinen más allá del texto visible ordinario.
El contexto geopolítico: la otra cara de Kimi K3
Moonshot presentó Kimi K3 a finales de septiembre como «el mayor sistema open-source del mundo», con 2,8 billones de parámetros y resultados que, según la propia compañía, superan a casi todos los modelos estadounidenses en sus benchmarks internos. La compañía lo ofreció como un gesto de apertura en un ecosistema dominado por laboratorios cerrados. El informe de OpenAI llega pocos días después y cuenta una historia distinta: que la apertura convive con operaciones opacas de extracción de propiedad intelectual ajena.
Esto no invalida a Kimi K3 como modelo. Sí pone en duda parte de la narrativa de que China lidera la IA abierta por mérito puramente técnico. Si parte de sus capacidades vienen de razonamiento destilado de GPT o Claude sin guardrails, la comparación con los modelos estadounidenses deja de ser justa. Y para los responsables de política tecnológica en Washington, refuerza el argumento de que las restricciones de exportación de chips, por sí solas, no cierran la brecha: la destilación por software es una puerta trasera que no necesita los chips más avanzados.
Lo que nos llevamos
El caso OpenAI–Moonshot es la primera vez que un laboratorio frontera publica, con detalle técnico, una operación de destilación adversaria a escala industrial. Lo que muestra es que la frontera de seguridad de la IA se ha movido de los servidores y las APIs al comportamiento del modelo en conversación: ya no basta con cifrar el razonamiento y confiar en que no se filtra, porque el modelo, si se lo pide con ingenio, lo va a soltar en la salida visible.
Para los profesionales de seguridad, las lecciones son dos. Primero, la destilación es un vector de exfiltración de IP que opera por canales legítimos y evade la mayoría de los WAF y DLP clásicos; hay que monitorizar patrones de prompt, no solo tráfico. Segundo, las arquitecturas que comparten razonamiento cifrado entre modelos del mismo proveedor son una vulnerabilidad sistémica que requiere coordinación entre laboratorios — algo que, hasta ahora, no existía.
El episodio deja una pregunta incómoda para la industria: si GPT, Claude y Gemini comparten la misma clase de fallo, ¿cuánto del supuesto «progreso» de los modelos chinos en 2026 es mérito propio y cuánto es razonamiento destilado de Silicon Valley? OpenAI no ha dado nombres de modelos afectados ni números concretos de qué se filtró. Moonshot no ha respondido a las acusaciones. La historia, probablemente, no haya hecho más que empezar.