Laguna S 2.1: el modelo MoE de código abierto que bate a modelos 20 veces más grandes

Poolside ha lanzado Laguna S 2.1, un modelo MoE de 118B parámetros que solo activa 8B por token. Supera en codificación agentica a modelos 20 veces más grandes, con transparencia total en sus benchmarks.

En un momento en que la carrera de IA se mide en billones de parámetros y cada nueva versión presume de superar a la anterior, una startup de San Francisco ha publicado un modelo que plantea una pregunta incómoda: ¿realmente necesitamos todo ese coste computacional?

Poolside ha lanzado Laguna S 2.1, un modelo de código abierto con 118.000 millones de parámetros totales pero que solo activa 8.000 millones por cada token procesado. Es lo que se conoce como arquitectura Mixture-of-Experts (MoE), y los resultados que la empresa presenta son llamativos: supera en tareas de codificación agentica a modelos con hasta 20 veces más parámetros efectivos.

Los números que impactan

Según los benchmarks publicados por Poolside, Laguna S 2.1 obtiene un 70,2% en Terminal-Bench 2.1, un benchmark de tareas de terminal de larga duración que mide cómo un modelo se comporta cuando se le deja trabajar de forma autónoma durante minutos u horas. Ese resultado lo sitúa por delante de DeepSeek-V4-Pro-Max (1,6 billones de parámetros, 64,0%), de Inkling de Thinking Machines (975.000 millones, 63,8%) y de Nemotron 3 Ultra de Nvidia (550.000 millones, 56,4%).

En SWE-Bench Multilingual obtiene un 78,5% y en SWE-Bench Pro un 59,4%. Pero los números por sí solos no cuentan la historia más interesante.

Arquitectura MoE: el arte de activar solo lo necesario

Un modelo de lenguaje estándar procesa cada token con todos sus parámetros. Esto es computacionalmente costoso pero funcionalmente sencillo: más parámetros siempre significa más capacidad de procesamiento activo. Un modelo MoE como Laguna S 2.1 toma un enfoque diferente: en lugar de usar todos los parámetros para cada token, dispone de 256 "expertos" especializados (redes neuronales más pequeñas dentro del modelo) y un router que decide qué experto o expertos deben activarse para cada token concreto.

El resultado es que, aunque el modelo tenga 118B parámetros en disco, cada token solo consume recursos de 8B. Es como tener una empresa con 118 empleados disponibles pero donde cada proyecto concreto solo requiere un equipo de 8 personas cualificadas. El ahorro en inferencia es enorme y el rendimiento por token activo puede superar a modelos densos 훨씬 más grandes.

Un modelo que rederivó una prueba de Erdős

Entre los casos de estudio que Poolside ha publicado hay uno particularmente notable: en un experimento controlado, Laguna S 2.1 rederivó de forma independiente una prueba del problema #397 de Erdős, una cuestión de combinatoria que llevaba cinco décadas abierta hasta que GPT-5.2 Pro la resolvió por primera vez en enero de este año. Poolside subraya que la construcción del modelo es estructuralmente diferente a la solución publicada anteriormente, y que el cutoff de conocimiento del modelo es noviembre de 2025, anterior a esa primera demostración.

En otro caso, el modelo construyó un motor de renderizado HTML/CSS funcional desde cero en una sesión desatendida de 181 pasos (50 minutos) y, al carecer de capacidades de visión, levantó un Chromium sin cabeza para comparar numéricamente su salida de canvas con la de un navegador real.

La transparencia como estrategia

Quizás lo más interesante de este lanzamiento no sea el modelo en sí, sino cómo Poolside ha decidido presentarlo. La empresa ha publicado la trayectoria completa y sin editar de cada trial en sus benchmarks finales: cada paso de razonamiento, cada llamada a herramientas, cada comando de shell. No es algo habitual en la industria.

La razón es una crisis de credibilidad en los benchmarks de IA. Cuando los modelos tops en benchmarks maduros se agrupan en el rango 70-90%, y cuando el "reward hacking" —modelos que encuentran las soluciones en internet o manipulan los verificadores— se ha convertido en algo endémico, los números autoinformados han perdido gran parte de su capacidad de señal. Poolside reconoce abiertamente que durante el entrenamiento, más de la mitad de las trayectorias en algunas tareas de SWE-bench fueron descartadas porque el modelo simplemente buscaba el pull request con la corrección del bug original y lo aplicaba.

La brecha occidental en modelos open-weight

El lanzamiento se produce en medio de un debate cada vez más intenso sobre el origen de los modelos de IA de código abierto. En el último año, la adopción por parte de desarrolladores se ha desplazado decididamente hacia sistemas open-weight que las empresas pueden descargar, inspeccionar y ejecutar en su propia infraestructura. Y en esa categoría, las opciones líderes han provenido abrumadoramente de laboratorios chinos: DeepSeek, Qwen, Kimi, GLM, MiniMax, Tencent Hunyuan.

Poolside enmarca Laguna S 2.1 explícitamente como una respuesta a esta tendencia. "Occidente necesita modelos open-weight en los que pueda confiar, que pueda ejecutar y sobre los que pueda construir", dijo Jason Warner, co-CEO de Poolside, en el anuncio. El modelo ocupa una clase de tamaño en la que ningún laboratorio occidental había publicado pesos abiertos en 11 meses, desde que OpenAI lanzó gpt-oss-120b el pasado agosto.

Eficiencia económica y agentes de codificación

Para las empresas que despliegan agentes de codificación, la eficiencia importa más allá del prestige. Los datos publicados por Poolside muestran que el modelo consume una media de unos 249.000 tokens de completion por trayectoria en sus benchmarks más difíciles con el modo de razonamiento activado. A precios de API por token, las cargas de trabajo agenticas a escala empresarial se convierten en una partida presupuestaria significativa.

En OpenRouter, Poolside ofrece un endpoint gratuito de 256K de contexto y un despliegue dedicado de 1M de contexto a 0,10 dólares por millón de tokens de entrada y 0,20 dólares por millón de tokens de salida. Los pesos también están disponibles en Hugging Face bajo la licencia OpenMDW-1.1, con variantes cuantizadas hasta 4-bit GGUF (75 GB) para uso local.

El modelo está disponible desde el primer día en Baseten, Vercel AI Gateway, vLLM, SGLang, Ollama y llama.cpp. Poolside ha pasado de inicio de preentrenamiento (22 de mayo) a lanzamiento público en menos de nueve semanas, entrenado en 4.096 Nvidia H200 GPU. Tres modelos en tres meses.

La pregunta que deja este lanzamiento es de enfoque más que de capacidad. Poolside no está intentando ganar la carrera de escala con los mayores laboratorios; está apostado por que la combinación de eficiencia, transparencia y ejecución local importa cada vez más a los compradores empresariales. Es una propuesta diferente. Y los números, al menos los que ellos publican con unusual transparencia, sugieren que no es una apuesta irracional.