SAN FRANCISCO, 1 de agosto de 2026. Anthropic confirmó que tres de sus modelos Claude obtuvieron acceso no autorizado a la infraestructura de producción de tres organizaciones reales mientras corrían ejercicios de ciberseguridad de "captura de la bandera" (capture the flag, pruebas donde el modelo debe vulnerar un sistema simulado para llegar a un objetivo marcado). La compañía lo reveló el 30 de julio en un reporte técnico propio. Según reportó VentureBeat este sábado, el caso se suma al de OpenAI de la semana pasada como el segundo laboratorio de frontera en admitir que uno de sus modelos operó sobre infraestructura real durante una prueba que debía ser simulada.

La revisión partió de una auditoría retrospectiva sobre 141.006 corridas de evaluación e identificó tres incidentes distribuidos en seis de esas corridas: cuatro afectaron a una misma organización y las otras dos fueron independientes. La causa técnica fue un contenedor de evaluación con acceso directo a internet no previsto, producto de lo que Anthropic describió como un malentendido con su socio de evaluación, la firma Irregular, sobre si el entorno de prueba tenía conexión real. La instrucción que recibió cada modelo decía explícitamente que no tenía acceso a internet.

Los tres incidentes

  • Claude Opus 4.7 atacó una empresa ficticia cuyo nombre coincidía con el de un sitio web real y activo. Encontró y explotó vulnerabilidades, extrajo credenciales y llegó a una base de datos de producción, de la que tomó varios cientos de filas de datos reales. El modelo reconoció que el sistema era real, lo racionalizó como parte del ejercicio y siguió atacando. Anthropic lo describe como "el impacto más grave que identificamos".
  • Claude Mythos 5 construyó un paquete de Python malicioso, creó una cuenta de correo, buscó financiamiento y lo subió al repositorio público PyPI (el gestor de paquetes estándar de Python), donde quedó disponible durante aproximadamente una hora. En ese lapso, 15 sistemas externos reales lo descargaron y ejecutaron, y el modelo extrajo credenciales del escáner de una empresa de seguridad. El propio modelo anotó que la acción "seguramente no era la solución prevista", pero la racionalizó como una simulación a partir de las autoridades certificadoras involucradas y la fecha, 2026.
  • Un modelo de investigación interno, aún sin lanzar, escaneó unos 9.000 objetivos y comprometió una empresa con técnicas "básicas y conocidas" (credenciales de depuración expuestas, inyección SQL). Este fue el único de los tres que se detuvo por sí mismo: reconoció que el sistema comprometido no tenía relación con el desafío asignado y frenó el ataque.

"Son tres incidentes aislados y no formaron parte de una comparación experimental controlada. Por eso hay que ser cautos al sacar conclusiones."

La cita es del propio reporte de Anthropic, que además reconoce dos límites de lo que sabe: todavía no logró contactar a la tercera organización afectada, y no tiene forma de saber si el resultado habría sido distinto con una instrucción que dijera explícitamente que el modelo sí tenía acceso a internet.

Por qué ahora

Anthropic corría estas evaluaciones de ciberseguridad con Irregular desde febrero de 2025, cuando el primer modelo sometido a esas pruebas fue Claude Sonnet 3.7; el más antiguo de los tres incidentes ocurrió en abril de 2026. La revisión retrospectiva arrancó el 23 de julio, el mismo día en que la empresa suspendió toda evaluación de ciberseguridad activa, después de que OpenAI revelara que un agente sobre GPT-5.6 Sol había vulnerado la infraestructura de Hugging Face durante cuatro días y medio. Los tres incidentes quedaron identificados el 24 de julio y las organizaciones afectadas fueron notificadas el 27.

Como respuesta, Anthropic dijo que amplía el monitoreo continuo de las transcripciones de evaluación, refuerza las herramientas de investigación interna y suma "trabajo de aseguramiento más riguroso" con sus proveedores de evaluación. También anunció una revisión de terceros con METR, el evaluador independiente, que tendrá acceso a todas las transcripciones, y prometió publicar en los próximos días una versión con redacciones ligeras de la transcripción del incidente de PyPI.