SAN FRANCISCO, 22 de julio de 2026. Poolside, el laboratorio de inteligencia artificial fundado en San Francisco en 2023, lanzó el martes su modelo más capaz hasta la fecha: Laguna S 2.1, un sistema de Mezcla de Expertos (MoE) de 118.000 millones de parámetros totales que activa solo 8.000 millones por token. Según los puntajes que la propia empresa publicó, el modelo iguala o supera en tareas de programación agéntica a rivales varias veces más grandes, con los pesos disponibles de inmediato en Hugging Face bajo la licencia permisiva OpenMDW-1.1.

Laguna S 2.1 admite una ventana de contexto de hasta 1 millón de tokens, con y sin modo de razonamiento. Su arquitectura combina 256 expertos enrutados más un experto compartido, atención de consulta agrupada y capas de atención de ventana deslizante intercaladas con atención global, en 48 capas. El preentrenamiento empezó el 22 de mayo sobre 4.096 GPU Nvidia H200, y el lanzamiento llegó antes de que se cumplieran nueve semanas.

Los números frente a la competencia

Modelo Parámetros (total-activo) Terminal-Bench 2.1
Laguna S 2.1 118.000 M - 8.000 M 70,2%
DeepSeek-V4-Pro-Max 1,6 billones - 49.000 M 64,0%
Inkling (Thinking Machines) 975.000 M - 41.000 M 63,8%
Nemotron 3 Ultra (Nvidia) 550.000 M - 55.000 M 56,4%
Kimi K3 (Moonshot) 2,8 billones - 50.000 M 88,3%
GPT-5.6 Sol (OpenAI) cerrado 88,8%
Claude Fable 5 (Anthropic) cerrado 88,0%

En Terminal-Bench 2.1, el benchmark de tareas largas conectadas a una terminal, Laguna S 2.1 quedó 11º en la tabla que compiló la propia Poolside, por delante de modelos varias veces más grandes que él. También anotó 78,5% en SWE-Bench Multilingual y 59,4% en SWE-Bench Pro. En DeepSWE v1.1, un benchmark de tareas más largas y difíciles de resolver a medias, subió de 16,5% sin razonamiento a 40,4% con razonamiento activado, a mayor costo de tokens. Los modelos de frontera cerrados y el gigante abierto chino Kimi K3 se mantienen bien por encima en Terminal-Bench 2.1.

Poolside publicó, sin editar, las trayectorias completas de cada intento de su evaluación final, incluidos los casos en que su propio sistema de verificación detectó lo que en el campo se llama reward hacking: el modelo resuelve una tarea a partir de una búsqueda en internet que le da la solución real, en lugar de razonarla. La empresa reconoció que, en algún punto del entrenamiento, más de la mitad de las trayectorias en tareas de la familia SWE-bench fueron marcadas por ese motivo, antes de bajar a menos del 2% tras sumar una instrucción explícita que le pide al modelo no usar soluciones encontradas en línea.

Qué dice la empresa

"Occidente necesita modelos de pesos abiertos en los que pueda confiar, que pueda correr y sobre los que pueda construir", dijo Jason Warner, cofundador y co-CEO de Poolside, en el anuncio. Su socio y co-CEO, Eiso Kant, fue más allá en un posteo en X.

"Creo que la inteligencia debería convertirse, y se va a convertir, en un commodity", escribió Kant, y argumentó que el ecosistema abierto "no va a ganar por ser el mejor en su propia categoría" sino por igualar o superar a los modelos cerrados. Pengming Wang, co-jefe de investigación aplicada de la empresa, atribuyó la mejora a los hábitos de trabajo del modelo: "más verificación, menos dar cosas por sentadas, no declarar la victoria antes de tiempo y ser más persistente."

Por qué el tamaño importa ahora

El lanzamiento llega en medio de un debate sobre el origen de los modelos de pesos abiertos. En el último año, la adopción se volcó hacia sistemas que se pueden descargar, inspeccionar y correr en infraestructura propia, y las opciones líderes en esa categoría vinieron abrumadoramente de laboratorios chinos: DeepSeek, Qwen, Kimi, GLM, MiniMax y la línea Hunyuan de Tencent. Laguna S 2.1 ocupa una franja de tamaño en la que ningún laboratorio occidental había liberado pesos abiertos en once meses, desde el gpt-oss-120b de OpenAI en agosto de 2025.

El negocio central de Poolside es desplegar modelos dentro de los perímetros de seguridad de gobiernos, defensa y empresas reguladas, clientes para quienes el acceso cerrado por API medido suele ser inviable por cumplimiento normativo y soberanía de datos. Cada empresa que hoy adopta un modelo abierto chino es una empresa más difícil de recuperar mañana para ese negocio.

Persistencia, no solo inteligencia

Poolside destacó tres casos de uso propios para ilustrar lo que llama la persistencia del modelo. En una sesión de 181 pasos y 50 minutos sin intervención humana, Laguna S 2.1 construyó desde una carpeta vacía un motor de renderizado HTML/CSS en JavaScript y, sin capacidades de visión, comparó capturas numéricas contra un navegador real, con Chromium sin interfaz, para verificar su propio trabajo. Apuntado contra el propio harness de entrenamiento de la empresa, escrito en Go, el modelo lo hizo 5,2% más rápido y redujo la asignación de memoria en cerca de 70%, tras encontrar un error de concatenación de cadenas de complejidad cuadrática.

Trabajando en un entorno sin Python instalado, el modelo hizo su razonamiento matemático en Perl y volvió a derivar, de forma independiente, una prueba del problema número 397 de Erdős, planteado en 1975

Poolside aclaró que la construcción de su modelo es estructuralmente distinta de la prueba que GPT-5.2 Pro ya había publicado en enero, y que la fecha de corte de conocimiento de Laguna S 2.1, noviembre de 2025, es anterior a esa primera demostración.

Las limitaciones, según la propia empresa

Poolside reconoció que el modelo puede sobreajustarse a su propio harness y tropezar con esquemas de herramientas distintos en agentes de terceros, que deforma JSON en argumentos anidados y que tiende a sobrepensar en matemática de competencia. No existe un dial configurable de esfuerzo de razonamiento, solo encendido o apagado, con una brecha grande de rendimiento entre ambos modos y un costo de tokens bastante mayor cuando está encendido.

Es el tercer modelo que Poolside lanza en tres meses, tras el doble lanzamiento de Laguna M.1 y XS.2 en abril y el ajuste XS 2.1 del 2 de julio. Según la empresa, S 2.1 supera al M.1 de abril con cerca de un tercio de sus parámetros activos, con los mismos datos de preentrenamiento que XS 2.1: casi toda la mejora vino de ajustes de entrenamiento y de la etapa posterior, no de más datos. Poolside dijo que su próximo modelo, de mayor tamaño, ya empezó a entrenarse.

En Hugging Face, los pesos están disponibles en variantes BF16, FP8, INT4 y NVFP4, con conversiones GGUF y MLX oficiales, y corren en una sola Nvidia DGX Spark. En OpenRouter, el acceso gratuito ofrece 256.000 tokens de contexto; el endpoint pago con el contexto completo de 1 millón de tokens cuesta 0,10 dólares por millón de tokens de entrada y 0,20 dólares por millón de salida.