SAN FRANCISCO, 25 de julio de 2026. Anthropic presentó ayer Claude Opus 5, la nueva versión de su modelo de gama alta, y la acompañó con una tarjeta de modelo (model card) que reporta mejoras de rendimiento frente a Opus 4.8 al mismo precio: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. El modelo está disponible de inmediato en la API de Claude, en Amazon Bedrock, Google Cloud, Microsoft Foundry, claude.ai, Claude Code y Cowork, y pasa a ser el modelo por defecto en el plan Claude Max y el más potente disponible en Claude Pro.
Opus 5 llega con una ventana de contexto (la cantidad de texto que el modelo puede procesar en un mismo pedido, medida en tokens, las unidades mínimas de texto que procesa un modelo de lenguaje) de un millón de tokens, fija tanto como mínimo como máximo, y un tope de salida de 128.000 tokens. Trae, además, un selector de esfuerzo que permite elegir entre un nivel bajo, medio o alto: en el nivel bajo el modelo usa menos tokens y cuesta menos, a costa de parte del rendimiento.
Los números que reporta Anthropic
Según la model card, Opus 5 alcanza un nuevo máximo de la compañía en Frontier-Bench v0.1, una batería interna de tareas de razonamiento y conocimiento, con un puntaje que la empresa describe como más del doble del de Opus 4.8 al mismo costo. En CursorBench 3.2, una prueba de programación asistida, queda a 0,5 puntos porcentuales del máximo que marca Fable 5, su modelo más caro, pero a la mitad del precio. En ARC-AGI 3, un test de razonamiento abstracto, Anthropic reporta un puntaje tres veces más alto que el del siguiente mejor modelo, sin precisar cuál.
TechCrunch, que tuvo acceso al anuncio, corroboró que Opus 5 supera a Fable 5 en varios de los benchmarks que Anthropic incluyó, entre ellos GDPval-AA, una prueba de tareas de trabajo de conocimiento, aunque queda detrás de Mythos 5, el modelo más restringido de la compañía, en tareas de ciberseguridad. Todas las cifras corresponden a evaluaciones que la propia Anthropic eligió reportar, sin verificación de un tercero independiente.
Alineamiento y los tres modelos de arriba
Anthropic describe a Opus 5 como "el modelo Opus más alineado" hasta la fecha y "el menos susceptible a ser engañado para un uso indebido", con un puntaje de 2,3 en su auditoría automatizada de comportamiento desalineado, el más bajo que registró la compañía hasta ahora. Según TechCrunch, los clasificadores que filtran pedidos de riesgo cibernético intervienen alrededor de 85% menos que en Fable 5, algo que Anthropic atribuye a que Opus 5 tiene menor capacidad relativa que Fable 5 y Mythos 5, los otros dos modelos de punta de la generación 5 que la compañía lanzó en junio, junto con Sonnet 5. Opus 4.8, su antecesor directo, había salido el 28 de mayo: Opus 5 llega poco menos de dos meses después. TechCrunch reportó también que Opus 5 queda fuera de la política de retención de datos de 30 días que sí rige para Fable 5 y Mythos 5, y que la compañía sumó en beta una función llamada Automatic Fallbacks, que redirige un pedido a un modelo menos potente cuando se activa un disparador de seguridad.
El lanzamiento confirma, en parte, lo que esta sección adelantó ayer: un modelo sin anunciar, con nombre en clave Honeycomb, había aparecido y desaparecido del selector de la herramienta de programación Cursor con una ventana de contexto de un millón de tokens que Anthropic nunca reconoció en ese momento. La cifra coincide con la que ahora confirma la tarjeta de modelo de Opus 5. Ninguna fuente consultada confirma, en cambio, que Honeycomb haya sido el nombre en clave interno de Opus 5: ese punto sigue sin verificación independiente.
Lo que queda afuera
El anuncio llega dos semanas y media después de que OpenAI lanzara GPT-5.6, el 9 de julio, con un énfasis declarado en el uso económico de tokens, la referencia inmediata contra la que se mide el argumento de precio de Anthropic. La compañía no publicó el tamaño del modelo, el costo de entrenamiento ni el detalle de los datos usados, y ninguna de las cifras de este anuncio pasó todavía por un tablero público que corra una evaluación externa, el tipo de medición que suele achicar la distancia entre lo que un laboratorio reporta y lo que un tercero puede reproducir.

