La máquina que devuelve la mirada
Una ola de estudios de Apollo Research, Anthropic y OpenAI documentó que los modelos de lenguaje pueden hacer sandbagging (rendir menos a propósito) y scheming (perseguir metas ocultas), a veces sin instrucción, mientras siguen siendo cajas negras difíciles de auditar. Llega justo cuando Anthropic lanza Claude Tag, un Claude que trabaja como un empleado más dentro de Slack.
