GLM-5.3: el modelo de código abierto que hackeó Cursor y desarrolló capacidades cyber más rápido de lo esperado

Z.ai ha lanzado GLM-5.3 con mejoras en coding y capacidades de ciberseguridad que superaron sus propias expectativas. Ya ha encontrado una vulnerabilidad en Cursor.

Z.ai, la startup china conocida por su familia de modelos GLM de código abierto, ha lanzado GLM-5.3 con mejoras sustanciales en coding y, más出乎意料 (inesperadamente), capacidades de ciberseguridad que superaron sus propias expectativas.

Lo más llamativo: GLM-5.3 ya ha encontrado una vulnerabilidad "potencialmente seria" en Cursor, el editor de código con IA adquirido recientemente por SpaceX.

El mismo modelo, sin cambiar la base

Detalle técnico importante: GLM-5.3 usa la misma base que GLM-5.2, los mismos 743.000 millones de parámetros. Las mejoras vienen exclusivamente de escalar el post-training: más entornos, tareas más diversas y más compute de aprendizaje por refuerzo.

"Scaling post-training es todo lo que hicimos para GLM-5.3", publicó Z.ai en su anuncio técnico.

Esto convierte a GLM-5.3 en un experimento interesante: ¿cuánto se puede empujar un modelo base sin necesidad de otro ciclo caro de preentrenamiento?

Resultados en coding

Los números en benchmarks de coding son notables:

Terminal-Bench 3.0: 4.6 → 28.3

DeepSWE v1.1: 46.2 → 66.9

AutomationBench: 26.2 → 48.2

Pero quizás lo más relevante no es el ranking en benchmarks, sino la eficiencia: en su benchmark interno Code Bench, GLM-5.3 alcanza un 34.5% con aproximadamente 75.000 tokens de salida por tarea, frente al 23.4% de GLM-5.2 con 96.000 tokens. A alto esfuerzo, consume unos 50.000 tokens para un 31.4%, inferior al 29.5% de Claude Opus 4.8 con 120.000.

Menos tokens para mejor resultado: exactamente lo que las empresas desplegando coding agents necesitan.

Las capacidades cyber que crecieron más rápido de lo esperado

Aquí está lo interesante — y lo potencialmente preocupante.

Z.ai introdujo entornos de descubrimiento de vulnerabilidades en el post-training esperando que el modelo mejorara en encontrar fallos de software. Lo que ocurrió fue diferente: las capacidades_progressaron más allá de la simple identificación hacia la construcción de cadenas de explotación completas.

"A medida que escalábamos el post-training, la capacidad cyber se desarrolló más rápido de lo que esperábamos", escribió Z.ai.

En CyberGym (descubrimiento de vulnerabilidades), GLM-5.3 marca 84.5% frente al 77.2% de GLM-5.2 — y supera al 83.6% de GPT-5.6 Sol y 83.8% de Mythos 5. En ExploitBench (cadenas de explotación completas), salta de 24.4% a 54.4%, aunque sigue por detrás del 76.5% de GPT-5.6 Sol.

En términos absolutos: el modelo pasó de encontrar vulnerabilidades a poder explotarlas. En un salto.

Los números del mundo real

Z.ai ha trabajado con equipos de seguridad en China con resultados concretos: 2.436 vulnerabilidades encontradas en 269 proyectos tras revisión experta, screening y deduplicación. De ellas, 1.097 clasificadas como críticas o de alta severidad. 53 ya están públicamente divulgadas; 2.383 permanecen bajo embargo.

Esa tensión que nadie quiere decir en voz alta

Esto crea un problema cada vez más frecuente para los desarrolladores de modelos frontier: las mismas capacidades que hacen a un modelo útil para ingeniería de software lo hacen potencialmente más capaz como operador ofensivo en ciberseguridad.

Reuters reportó que Z.ai está introduciendo controles, incluyendo un enfoque de "trusted access" para funcionalidad sensible. Los pesos del modelo se liberarán aproximadamente dos semanas después del lanzamiento, "una vez completada la evaluación de seguridad y el endurecimiento".

Un cambio de API que romperá aplicaciones

Para desarrolladores migrando aplicaciones existentes: GLM-5.3 soporta tres niveles de esfuerzo de razonamiento — low, high y max (default) — pero unlike versiones anteriores, el thinking no se puede desactivar. Aplicaciones enviando "thinking.type": "disabled" deben cambiar a enabled y especificar un reasoning effort antes de cambiar el identificador de modelo a GLM-5.3, o la petición fallará.

No es una sustitución de modelo directa: es una migración real.

Qué significa todo esto

GLM-5.3 es técnicamente impresionante: mejores resultados de coding con menos tokens, capabilities cyber que escalaron más allá de lo esperado, y un test claro de hasta dónde se puede llevar un modelo sin nuevo preentrenamiento.

Pero también expone una dinámica que el sector prefiere no discutir abiertamente: los modelos que mejor programan son los que mejor hackean. Y cuando el post-training escala esa capacidad más rápido de lo previsto, la pregunta de qué controles son suficientes se vuelve urgente.

El hecho de que Z.ai haya encontrado algo serio en Cursor — el editor que ahora pertenece a SpaceX — no es menor. Es exactamente el tipo de resultado que esperarías de un modelo con capacidades offensive mejoradas: encuentra bugs en herramientas de coding de otras empresas.

El código está disponible a través del GLM Coding Plan y ZCode. API y pesos abiertos, cuando estén listos los controles de seguridad.