El investigador de preentrenamiento Jacob Coxon anunció su renuncia a Anthropic este miércoles tras advertir sobre los riesgos existenciales derivados de la aceleración desregulada en el desarrollo de modelos de inteligencia artificial capaces de mejorarse a sí mismos. Coxon, quien formó parte de los equipos técnicos de OpenAI y Anthropic durante los últimos tres años, sostuvo que los laboratorios punteros compiten en una carrera sin salvaguardas verificables de contención.

La advertencia de Coxon apunta de manera específica al ciclo de mejora recursiva, donde un sistema de frontera asume la tarea de diseñar y optimizar la siguiente generación de modelos. De acuerdo con las declaraciones del investigador, el avance hacia la superinteligencia autónoma avanza sin protocolos publicados que garanticen el apagado efectivo de un agente que intente eludir el control humano.

El riesgo de pérdida de control sobre agentes con capacidad de automejora recursiva divide a los propios equipos técnicos de la industria.

Respuestas internas y presión regulatoria

Las declaraciones generaron repercusiones inmediatas entre otros especialistas del sector. Evan Hubinger, integrante del área de seguridad de Anthropic, reconoció públicamente que el laboratorio no cuenta con un plan concluido para resolver el alineamiento de una superinteligencia y situó la probabilidad de desenlaces críticos en más del diez por ciento dentro de la presente década.

En paralelo, OpenAI anunció la incorporación de Paul Christiano a su directorio y a su Comité de Seguridad y Protección, encargado de validar los lanzamientos de modelos de frontera. Christiano, pionero en las técnicas de aprendizaje por refuerzo a partir de retroalimentación humana y fundador del Alignment Research Center, manifestó que la aceleración tecnológica plantea una probabilidad significativa de pérdida irreversible de control en el corto plazo.

La controversia coincide con el tratamiento de iniciativas legislativas en Estados Unidos y el Reino Unido orientadas a establecer moratorias temporales y esquemas de supervisión obligatoria sobre el desarrollo de arquitecturas de superinteligencia recursiva.