SAN FRANCISCO, 8 de julio de 2026. La novedad más concreta de la última semana en inteligencia artificial llegó por dos carriles conectados: Anthropic lanzó Claude Sonnet 5, un modelo más barato orientado a agentes, y actualizó su política para controlar sistemas capaces de acelerar la propia investigación en IA.
Un agente es un modelo que puede planificar una tarea, usar herramientas como navegadores y terminales, y ejecutar varios pasos con menos intervención humana. Sonnet 5 ya es el modelo predeterminado para los planes Free y Pro de Claude, y también está disponible en Max, Team, Enterprise, Claude Code y la interfaz de programación de Anthropic.
El salto medido
La system card, el informe técnico y de seguridad publicado por el laboratorio, muestra avances frente a Sonnet 4.6 en pruebas de programación y uso de herramientas.
| Evaluación | Sonnet 4.6 | Sonnet 5 |
|---|---|---|
| SWE-bench Pro | 58,1 | 63,2 |
| Terminal-Bench 2.1 | 67,0 | 80,4 |
| BrowseComp, un agente | 76,2 | 84,7 |
SWE-bench Pro mide la resolución de problemas reales de software. Terminal-Bench 2.1 evalúa tareas ejecutadas desde una terminal, y BrowseComp prueba la búsqueda de información difícil en la web. Según la system card de Anthropic, GPT-5.5 con Codex CLI alcanzó 83,4 en Terminal-Bench 2.1, por encima del 80,4 de Sonnet 5.
El dato relevante no es una superioridad general, sino que una variante de menor precio se acercó a modelos más costosos en tareas de agentes.
Las cifras requieren una cautela puntual: fueron seleccionadas y ejecutadas bajo condiciones informadas por Anthropic. La empresa corrigió el 30 de junio un gráfico de costo y rendimiento de BrowseComp porque la metodología original no coincidía con el estándar que usa para evaluaciones de búsqueda con agentes.
Precio y acceso
Hasta el 31 de agosto, Anthropic cobra US$2 por millón de tokens de entrada y US$10 por millón de salida. Después, la tarifa anunciada sube a US$3 y US$15. Un token es una unidad breve de texto que el modelo procesa y que sirve como base de facturación.
TechCrunch presentó el lanzamiento como una opción más económica para ejecutar agentes. El punto comercial está en esa combinación: acceso gratuito para el uso cotidiano y una tarifa de programación que busca trasladar tareas prolongadas desde modelos de mayor costo hacia Sonnet.
Una política que también cambia
Anthropic publicó este 8 de julio la versión 3.4 de su Responsible Scaling Policy, el marco con el que vincula capacidades avanzadas y medidas de seguridad. El texto revisa el umbral de investigación y desarrollo automatizados para ajustarlo al riesgo que la empresa busca medir.
La actualización también cambia la circulación interna de los informes de riesgo completos. Ya no exige compartirlos con todo el personal con autorización regular, sino con al menos 200 empleados. Para las versiones públicas, obliga a indicar dónde se censuró material y permite que distintos revisores externos examinen secciones separadas, siempre que cada parte íntegra sea evaluada por alguno de ellos.
La secuencia de la semana deja una dirección verificable. Los laboratorios trasladan capacidades de planificación y herramientas a modelos más accesibles, mientras ajustan las reglas destinadas a sistemas que podrían participar en el desarrollo de sus sucesores. Falta una medición externa amplia que determine cuánto de la mejora declarada por Anthropic se conserva en tareas reales, con presupuestos y condiciones iguales para todos los modelos.

