SWE-2 de Cognition: cómo la frontera de Pareto redefine el coste de la IA que programa

Cognition presenta SWE-2, un modelo de coding que iguala a GPT-6 Astra a un cuarto de su precio. La clave: entrenar todos los niveles de esfuerzo en una sola carrera de RL con penalizaciones de coste inspiradas en la geometría de la frontera de Pareto.

Ayer cubrimos cómo GPT-6 Astra reescribió las reglas de la profundidad en modelos de lenguaje. Hoy Cognition responde con un modelo que planta cara a esa frontera — a un precio que hace que la conversación sobre coste-rendimiento pase a primer plano.

SWE-2, presentado ayer 9 de septiembre, alcanza el 50% en FrontierCode 1.1 Main — a un punto de Fable 5.1 y a solo tres puntos de GPT-6 Astra — pero costing un 64% menos que este último. En DeepSWE 1.1 supera a todos los modelos de su clase, incluyendo GPT-5.6 Sol y Grok 4.6.

El modelo parte de Kimi K3, un modelo de 2.8 billones de parámetros que ya había sido entrenado con RL extensivo para coding agentivo. Sobre esa base, el equipo de Cognition aplica un enfoque que denominan "penalizaciones de coste informadas por la Frontera de Pareto" — y aquí es donde merece la pena detenerse.

La intuición detrás de la frontera de Pareto en RL

En aprendizaje por refuerzo aplicado a modelos de lenguaje, el objetivo habitual es maximizar una señal de recompensa. El problema es que"éxito" y"coste" son dos dimensiones que compiten: un modelo puede resolver más tareas gastando más compute, o resolver menos tareas pero más rápido y más barato.

La frontera de Pareto es el conjunto de puntos en el plano coste-rendimiento donde no puedes mejorar una dimensión sin empeorar la otra. El objetivo de Cognition era avanzar esa frontera hacia arriba — es decir, conseguir más rendimiento por el mismo coste — pero sin renunciar a ninguno de los niveles de esfuerzo que el modelo ofrece.

La fórmula que utilizan es:

R = S − λₑ·C

Donde S es binario (0 o 1, éxito o fracaso), C es el coste de la rollout en dólares, e es el nivel de esfuerzo, y λₑ es un parámetro ajustado para igualar la pendiente local de la frontera de Pareto del modelo base en cada nivel de esfuerzo.

La elección de λₑ no es un hiperparámetro arbitrario. La condición geométrica es sencilla: la línea iso-recompensa (línea de igual recompensa) debe ser tangente a la frontera de Pareto en el punto actual. Si λₑ es demasiado alto, el modelo "finge" ser una versión de menor esfuerzo para reducir coste sin ganar realmente capacidad. Si es demasiado bajo, la optimización no distingue entre esfuerzo y coste. Solo cuando λₑ = m (donde m es la pendiente local de la frontera) la recompensa se maximiza avanzando realmente la frontera.

Un solo RL run para todos los niveles de esfuerzo

El resultado práctico es que SWE-2 entrena esfuerzo medio, alto y máximo en una única carrera de RL. No se entrenan expertos separados que luego se distilan (el enfoque de Kimi K3), ni se usan presupuestos de tokens específicos por paso de entrenamiento. Un solo proceso de optimización avanza toda la curva de coste-rendimiento simultáneamente.

Los resultados en comportamiento real lo confirman. En FrontierCode 1.1 Main, SWE-2 medium realiza su primera edición significativa tras una mediana de 18 pasos, frente a los 48 de SWE-1.7. El modelo es más inteligente — sabe qué partes del código importan para la tarea — y por tanto más eficiente. En media, resuelve la misma tarea con un 81% menos de coste.

Disponible ya en Devin Desktop, CLI y Web, SWE-2 representa la concreción más clara hasta la fecha de algo que el campo lleva tiempo discutiendo: que la batalla en IA no será solo de inteligencia bruta, sino de inteligencia eficiente. La frontera de Pareto no es un concepto abstracto — es el terreno donde se decide qué modelo merece desplegarse en producción.

Fuente: Introducing SWE-2: Pushing the Pareto Frontier, Cognition, 10 de septiembre de 2026.