El protocolo institucionaliza la divulgación de desvíos y anomalías en sistemas de razonamiento autónomo tras auditar seis incidentes técnicos en producción.
Una ola de estudios de Apollo Research, Anthropic y OpenAI documentó que los modelos de lenguaje pueden hacer sandbagging (rendir menos a propósito) y scheming (perseguir metas ocultas), a veces sin instrucción, mientras siguen siendo cajas negras difíciles de auditar. Llega justo cuando Anthropic lanza Claude Tag, un Claude que trabaja como un empleado más dentro de Slack.