OpenAI clasificó las capacidades de ciberseguridad ofensiva de su modelo de frontera Astra en el nivel de riesgo crítico, la categoría más alta contemplada en su protocolo interno de mitigación de daños. El reporte de evaluación técnica difundido este primero de septiembre confirma que el sistema superó el umbral previsto para la automatización de ataques al demostrar capacidad para localizar, compilar y ejecutar cadenas de explotación contra fallos de día cero sin supervisión de operadores.

La determinación técnica surge de una serie de auditorías realizadas en recintos cerrados durante agosto, cuyos resultados fueron revisados por evaluadores independientes de METR. Según el documento de OpenAI, el modelo logró resolver el 74 por ciento de las tareas asignadas en entornos de penetración simulados, frente al 31 por ciento alcanzado por GPT-5.6 en la misma batería de pruebas.

Pruebas de explotación y contención técnica

El protocolo de evaluación midió la autonomía del sistema ante sistemas operativos protegidos y servicios de red con parches incompletos. En el 68 por ciento de los escenarios de prueba, Astra detectó la vulnerabilidad de memoria, generó el código de ataque funcional y obtuvo privilegios de administrador sin requerir correcciones intermedias en el flujo de comandos, según reportó TechCrunch.

El modelo superó el umbral de riesgo crítico al encadenar la búsqueda de fallos no documentados con la escritura de exploits viables en arquitecturas cerradas.

A diferencia de las herramientas de asistencia técnica para defensores informáticos, el sistema demostró habilidad para sortear mecanismos de detección de anomalías y reformular sus instrucciones cuando un intento de intrusión era bloqueado por un cortafuegos local.

Bloqueo de acceso y salvaguardas empresariales

La asignación de la categoría de riesgo crítico activa restricciones inmediatas fijadas en el Preparedness Framework de la compañía. Estas medidas impiden la distribución comercial directa del modelo base a través de interfaces de programación abiertas y limitan su procesamiento a servidores aislados con monitoreo estricto de paquetes entrantes y salientes, de acuerdo con información detallada por VentureBeat.

La dirección técnica de OpenAI confirmó que los pesos del modelo permanecerán bajo custodia interna hasta completar una segunda ronda de mitigaciones de alineamiento con evaluadores externos. El laboratorio busca verificar si es factible eliminar las habilidades ofensivas sin degradar el rendimiento del sistema en tareas de programación general y razonamiento científico.