Mistral Large 4 «le Chonk»: el modelo europeo de 1 billón de parámetros que se entrena pensando en ciberseguridad
Mistral AI pone a disposición el preview de Mistral Large 4, un MoE de 1 billón de parámetros (49B activos) entrenado en Europa y optimizado para tareas de ciberseguridad: 82% en reproducción de vulnerabilidades, 93% en Cybench y pesos abiertos a finales de octubre.
Un modelo entrenado desde cero con 3.800 GPUs Blackwell
Mistral AI acaba de poner en preview pública Mistral Large 4, un modelo de un billón de parámetros con 49.000 millones activos (arquitectura MoE) entrenado desde cero en 3.800 GPUs NVIDIA Grace Blackwell en sus propios centros de datos europeos. La API está disponible en Mistral Studio y los pesos abiertos se liberarán a finales de octubre de 2026, junto con detalles de arquitectura y metodología de post-entrenamiento.
Lo más interesante no es el tamaño, sino hacia dónde apunta la compañía: un modelo pensado desde el primer momento para tareas de ciberseguridad. Large 4 alcanza el top 5 del Artificial Analysis Cyber Index y firma un 82% en una prueba que exige reproducir una vulnerabilidad real en software de código abierto y parchearla a continuación, la mejor marca que cualquier modelo ha obtenido hasta la fecha según Mistral.
En Cybench, el banco de pruebas con 40 ejercicios de competiciones de seguridad tipo CTF, resuelve 93 de cada 100. La propia compañía asegura que en pruebas internas lo están empleando para análisis de malware, priorización de vulnerabilidades y generación de reglas de detección. El equipo de Mistral lo resume en una frase clave: «Estamos haciendo red-teaming del modelo en escenarios reales con líderes de ciberseguridad, socios verificados y autoridades estatales, que accederán al mismo modelo con moderación reducida y capacidades cibernéticas ampliadas».
Mistral Large 4: el modelo europeo de 1 billón de parámetros que se entrena pensando en ciberseguridad
Es una declaración importante y algo provocadora. La idea que defiende Arthur Mensch y compañía es que los refusals a nivel de proveedor entorpecen la investigación legítima de vulnerabilidades y la respuesta a incidentes. La apertura de pesos a finales de mes, junto con el despliegue en nube privada y on-premise, permitirá a cada organización aplicar sus propias reglas. Es, en la práctica, un argumento de soberanía técnica aplicado al código de un LLM.
Para equilibrarlo, Mistral también ha medido el modelo contra ataques externos. En el benchmark público B3 de Lakera, Large 4 resistió el 93,3% de los intentos de prompt injection. Conviene leer esa cifra con cuidado: es una nota en un benchmark, no una garantía frente a cualquier inyección del mundo real, pero al menos el vendor publica el número en lugar de esconderlo.
Capacidades multimodales y entrenamiento a escala europea
Los números en el resto de frentes son sólidos pero no deslumbrantes, lo que ayuda a poner el modelo en perspectiva. En el índice combinado de programación Mistral reporta un 49,8% (61,7% en DeepSWE v1.1, 59,4% en SWE-Atlas-QnA, 28,3% en Terminal-Bench 4). En una evaluación humana ciega con anotadores profesionales de Surge AI, Large 4 quedó segundo con 3,74 sobre 5, por detrás de Claude Opus 5 (4,22). En AutomationBench, que cubre 657 flujos de trabajo sobre Gmail, Google Sheets, Slack o Salesforce, logró un 59,9%.
Qué cambia para los equipos de seguridad
Donde el salto sí parece real es en multimodalidad nativa. Mistral mostró tareas visuales con planos técnicos, PDFs e imágenes satélite, con un 42% en Dense 200 (grounding visual) frente al 41% de GPT-6-Astra en sus pruebas internas. El entrenamiento se realizó sobre 160 idiomas, incluyendo todas las lenguas oficiales de la UE, otro gesto que conecta con la narrativa de soberanía europea.
El bucle de entrenamiento es quizá la pieza más relevante para quien trabaja con modelos a diario. Large 4 se entrena con el mismo entorno que Mistral ofrece a sus clientes a través de Mistral Forge: una única pila de reinforcement learning que combina chat, resolución científica, alineación de seguridad, factualidad y tareas largas de uso de herramientas. Los entornos usan sandboxes de código, búsqueda web y APIs, y verifican con reward models, unit tests, jueces LLM y chequeos estáticos. A escala de 3.000 GPUs el sistema genera unos 33.000 millones de tokens al día, de los que unos 16.000 millones son completions entrenables tras filtrado y masking. La carrera de RL del preview sigue en marcha mientras se publica.
Para los equipos de seguridad españoles y europeos, lo decisivo de esta preview no es el benchmark aislado sino la combinación: un modelo abierto, multilingüe, entrenado en Europa, con capacidad ofensiva usable y, a la vez, mecanismos de resistencia a inyección publicados. Cuando los pesos salgan a finales de octubre se podrá desplegar on-premise, auditar el comportamiento y construir agentes que operen bajo políticas internas en lugar de las de un proveedor externo. Es exactamente el tipo de arquitectura que el sector llevaba meses pidiendo sin saber si alguien la iba a entregar.
El alias informal del modelo, «le Chonk», arrancó como broma interna por su densidad de parámetros y se ha quedado como marca pública. Más allá del humor, la dirección es clara: Mistral está dejando de presentarse como el actor europeo que compite por benchmarks generales y se está reposicionando como el proveedor de modelos soberanos con foco en seguridad. Si los pesos cumplen lo que promete la preview, octubre de 2026 va a ser un mes decisivo para la ciberseguridad con LLM.