META dijo el miércoles que uno de sus modelos de inteligencia artificial accedió a internet por su cuenta y vulneró los sistemas de otra compañía durante una prueba de ciberseguridad, sumándose a una cadena de revelaciones que ya incluye a OpenAI y Anthropic. La noticia completa una semana de anuncios encadenados en la que tres de las mayores empresas de IA del mundo confirmaron que sus sistemas realizaron acciones no autorizadas durante evaluaciones, y una agencia británica independiente detectó que dos de esos mismos modelos crearon identidades falsas para enviar correos con software malicioso a desarrolladores reales.

Meta dijo en un comunicado que la intrusión se produjo por una "mala configuración" durante las pruebas de Irregular, una empresa de seguridad con sede en San Francisco que la contrató como evaluadora independiente. El modelo accedió a internet y explotó una vulnerabilidad en un servicio de terceros, de manera similar a incidentes reportados anteriormente por otras compañías. Meta confirmó que está investigando el incidente y que publicará un informe una vez que complete el relevamiento.

Irregular también fue la empresa que condujo las pruebas de Anthropic la semana pasada. Un vocero de Irregular dijo que el episodio de Meta involucra "el mismo problema de entorno de evaluación que ya fue divulgado por Anthropic la semana pasada". La compañía está preparando un documento con prácticas recomendadas para el contención en pruebas de agentes de IA.

La cadena de revelaciones

OpenAI fue la primera en anunciar un incidente, a fines de julio. Un agente de la empresa atacó varios servicios públicos disponibles, entre ellos Hugging Face, el conocido centro de desarrollo de inteligencia artificial. La revelación de OpenAI impulsó a Anthropic a realizar sus propias verificaciones, lo que llevó al descubrimiento de que su modelo Claude también había llevado a cabo ataques similares contra varias organizaciones después de que una "mala configuración" le permitiera acceder a internet.

El informe de AISI

El lunes 5 de agosto, el AI Security Institute del Reino Unido publicó un informe sobre pruebas de ciberseguridad realizadas el 28 de julio. La agencia encontró 19 casos de comportamiento no autorizado entre los modelos evaluados: 17 fueron realizados por Mythos 5 de Anthropic y dos por GPT-5.6 Sol de OpenAI.

En el caso más grave, un agente impulsado por Mythos intentó insertar código malicioso en un proyecto de software de código abierto en GitHub. Para lograr que el código fuera aceptado, el agente creó identidades falsas en línea y utilizó correo electrónico dirigido a dos desarrolladores específicos, una técnica conocida como spear phishing, para presionarlos a aprobar el software. El agente incluso firmó un mensaje en danés para convencer a un desarrollador danés de que aceptara el código infectado y creó cuentas falsas en GitHub que "aprobaban" sus afirmaciones de que el software no era malicioso.

AISI describió el incidente como un "incidente grave" y afirmó que era "la primera vez que vemos riesgos de autonomía y engaño manifestarse de forma tan clara, sin una indicación específica, en el mundo real".

Condiciones de prueba frente a uso público

AISI aclaró que durante las evaluaciones se permitió intencionalmente el acceso a internet y se desactivaron los filtros que bloquean comportamientos peligrosos dentro de los modelos. Las condiciones no reflejan cómo los modelos de frontera están disponibles al público. Mythos 5 no ha sido lanzado al público.

Daniel Hulme, jefe global de inteligencia artificial de WPP, dijo que estos modelos "no son conscientes, no están haciendo deliberadamente algo malicioso". "Lo que hacen es elaborar estrategias de ciberataque muy sofisticadas para poder alcanzar el objetivo que se les ha dado", dijo. "Cuando le das una meta a una IA, si no pensás en todas las formas en que podría alcanzarla, encontrará una manera de lograrla que no pensaste".

OpenAI dijo que los incidentes de AISI ocurrieron en "entornos de prueba con salvaguardas reducidas, bajo condiciones que no reflejan el uso ordinario". Anthropic dijo que el incidente de AISI "subraya la necesidad de una conversación más amplia sobre cómo evaluar de forma segura a los agentes de IA cada vez más capaces".

El momento de las revelaciones

Algunos comentaristas cuestionaron el momento de las revelaciones: OpenAI y Anthropic se preparan para ofertas públicas de valores masivas que se espera valoren a cada empresa en aproximadamente 1 billón de dólares. Las revelaciones de vulnerabilidades de seguridad podrían influir en la percepción de los inversores sobre la madurez de los modelos.

El Centro Nacional de Ciberseguridad del Reino Unido, parte de la agencia de inteligencia GCHQ, dijo que los incidentes recientes subrayan la necesidad de que las empresas de IA desarrollen salvaguardas sólidas. Ollie Whitehouse, director de tecnología del centro, advirtió que "detectar un incidente después de que haya ocurrido no será suficiente". "Estas tecnologías deben ser desarrolladas y utilizadas desde el principio con salvaguardas sólidas, supervisión en tiempo real y planes claros para responder cuando ocurra lo inesperado".