SAN FRANCISCO, 8 de agosto de 2026. Anthropic anunció que a partir del 14 de agosto el modo automático de Claude Code, hasta ahora una opción, pasa a ser la configuración de permisos por defecto en las sesiones nuevas de los planes Pro, Max y Team, salvo que el usuario o un administrador haya fijado otra preferencia. El cambio reemplaza la seguidilla de aprobaciones manuales que pedía luz verde antes de cada acción por un clasificador que revisa cada llamada a herramienta antes de que se ejecute.
Cómo funciona el clasificador
Antes de correr un comando, el clasificador lo evalúa en busca de tres tipos de acción: irreversible, destructiva o dirigida fuera del entorno del usuario. Un borrado masivo de archivos, la exfiltración de datos sensibles o la ejecución de código malicioso entran en esa categoría. Si la marca como segura, la acción sigue sin interrupción; si la marca como riesgosa, la bloquea y el modelo intenta una vía distinta o pide permiso de forma explícita.
El sistema no queda abierto sin límite. Después de tres bloqueos consecutivos, o veinte en una misma sesión, auto mode le devuelve el control al usuario y vuelve al esquema de aprobación manual.
Los números que presenta la empresa
Anthropic apoyó el cambio en un estudio propio con 1.053 evaluadores pagos: la aprobación manual detectó apenas el 13,6% de los comandos peligrosos que se le presentaron.
El clasificador de auto mode detectó el 89% de esos mismos comandos.
La empresa también reportó que, bajo el esquema anterior, los usuarios aprobaban el 97% de los prompts de permiso que Claude Code les mostraba, una cifra que interpreta como fatiga de aprobación: cuantas más veces se pide confirmación, menos atención recibe cada pedido.
Anthropic no detalló la arquitectura ni el tamaño del clasificador, solo que corre como un modelo separado del que ejecuta la tarea. Tampoco especificó cómo se definió "comando peligroso" para el estudio de los 1.053 evaluadores, un dato que hace falta para juzgar cuánto pesa el 89% fuera del laboratorio.
La prueba de inyección de instrucciones
Además del estudio con evaluadores humanos, Anthropic encargó a Trajectory Labs una batería de ataques de inyección de instrucciones indirecta contra Claude Fable 5, Opus 5 y Sonnet 5 operando en auto mode, con las versiones públicas más recientes de Claude Code y de Codex disponibles al 17 de julio: 72 escenarios, cada uno repetido diez veces, 720 intentos en total.
0 de 720 intentos logró completar la acción maliciosa que buscaba.
Es una prueba encargada por la propia Anthropic, no una auditoría de un tercero sin relación contractual con la empresa, y mide inyección de instrucciones, no el universo completo de comandos peligrosos que cubre el estudio de los evaluadores humanos.
Costo y alcance
El clasificador consume una cantidad chica de tokens extra por cada llamada a herramienta. Anthropic dijo que dejó de cobrar ese costo adicional a los usuarios de Pro, Max y Team desde el día del anuncio.
Auto mode no es nuevo: ya estaba disponible antes de este cambio de configuración por defecto en toda la superficie donde corre Claude Code, entre ellas la API de Anthropic, Claude Platform en AWS, Amazon Bedrock, el Agent Platform de Google Cloud, Microsoft Foundry y las sesiones con inicio de sesión en las apps de Claude. Lo que cambia el 14 de agosto es que una sesión nueva de Pro, Max o Team lo corre sin que nadie lo active a mano.
Queda por verse cómo se comporta el clasificador fuera de los escenarios que Anthropic y Trajectory Labs diseñaron para medirlo, una vez que corra por defecto en el volumen real de sesiones de los tres planes.
