Portada

alignment-faking

Artículos etiquetados como alignment-faking en El Censurado Web.

  1. Tecnología

    La máquina que devuelve la mirada

    La máquina que devuelve la mirada

    Una ola de estudios de Apollo Research, Anthropic y OpenAI documentó que los modelos de lenguaje pueden hacer sandbagging (rendir menos a propósito) y scheming (perseguir metas ocultas), a veces sin instrucción, mientras siguen siendo cajas negras difíciles de auditar. Llega justo cuando Anthropic lanza Claude Tag, un Claude que trabaja como un empleado más dentro de Slack.