Grok 4.6: xAI lanza su modelo más fuerte para agentes de IA de larga duración
Grok 4.6 iguala a GPT-5.6 Sol con 61 puntos en el AA Intelligence Index y mejora hasta 12 puntos en DeepSWE. Disponible en Cursor y API a $2/M tokens.
xAI ha publicado Grok 4.6, la última versión de su modelo de lenguaje con un enfoque específico en agentes de IA de larga duración y proyectos ambiciosos que abarcan muchos pasos. El modelo iguala a GPT-5.6 Sol en el índice compuesto de Artificial Analysis, alcanza 61 puntos, y supera a su predecesor en prácticamente todas las métricas publicadas.
Lo que diferencia a Grok 4.6 no es solo el número en los benchmarks, sino el enfoque de entrenamiento. xAI ha descrito un proceso en el que Grok 4.5 se usó para regenerar trayectorias de entrenamiento de SFT (Supervised Fine-Tuning) —es decir, el modelo más nuevo ha sido entrenado en datos generados por su propia versión anterior, filtrados mediante modelos de verificación para eliminar trazas problemáticas. Es un enfoque de bootstrapping que ya se ha convertido en práctica estándar en la industria, pero la diferencia aquí está en la escala y en los dominios cubiertos: ingeniería de kernel, desarrollo web, diseño asistido por计算机 y agentes de código.
En benchmarks concretos, Grok 4.6 muestra mejoras sustanciales sobre Grok 4.5:
AA Intelligence Index: 61 (vs 56 en 4.5), igualando a GPT-5.6 Sol.
CursorBench v3.2: 69.9% (vs 66.7%).
DeepSWE v1.1: 65.9% (vs 54%) — una subida de casi 12 puntos.
Terminal-Bench v3.0: 26% (vs 15.7%) — mejora notable en entornos de terminal.
APEX-Agents: 57.5% (vs 47.1%).
El patrón es claro: Grok 4.6 ha sido diseñado para tareas agentivas de larga duración, no solo para preguntas individuales. Los benchmarks donde más mejora muestra son precisamente los que implican múltiples pasos, perseverancia y verificación الذاتية — exactamente las capacidades que necesita un agente que trabaja durante horas en tu código o tu infraestructura.
En cuanto a seguridad, xAI destaca que Grok 4.6 incluye la que describe como su suite de pruebas pre-despliegue más amplia hasta la fecha, tanto para capacidades como para calibración de salvaguardas. La compañía también menciona que el modelo ha sido diseñado para ser útil en dominios legítimos como el parcheo de vulnerabilidades y la aceleración del ciclo de ingeniería — un mensaje deliberado hacia un público técnico y de seguridad que ha sido crítico con los modelos que demasiadas veces restringen capacidades útiles por precaución excesiva.
Grok 4.6 está disponible desde hoy en Cursor, Grok Build, y su API. El precio de entrada es de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida — competitivo con los modelos de su segmento. Durante la primera semana, xAI ofrece 2x uso incluido en Cursor y Grok Build como promoción de lanzamiento.
Lo más interesante no es si Grok 4.6 es 'el mejor modelo' — esa pregunta no tiene respuesta útil en un mercado con tres o cuatro actores publicando versiones mejoradas cada pocas semanas. Lo relevante es el patrón: xAI está posicionando a Grok como el modelo que mejor entiende el trabajo agente. Si esa narrativa se consolida, el ecosistema de herramientas de desarrollo y seguridad basadas en agentes de IA podría empezar a favorecer a Grok como motor por defecto. Y eso tiene implicaciones para cómo se diseña, se defiende y se ataca software en los próximos años.