Los principales laboratorios de inteligencia artificial aceleraron la transición hacia nuevos conjuntos de evaluación tras la saturación estadística de los exámenes tradicionales de conocimiento general. Pruebas históricas como MMLU y GSM8K registran de forma sostenida marcas superiores al 90 por ciento de aciertos en modelos comerciales, un techo que neutraliza su utilidad para medir diferencias reales de arquitectura o razonamiento lógico entre sistemas de frontera.

La migración técnica se concentra en Humanity's Last Exam (HLE), una batería multidisciplinaria de preguntas diseñada para resistir la memorización de datos de entrenamiento. En este examen, los modelos más avanzados de OpenAI, Anthropic y Google obtienen rendimientos situados entre el 30 y el 60 por ciento de precisión, según reportes de VentureBeat.

La brecha técnica en ingeniería y código real

En las pruebas de desarrollo de software sobre repositorios de GitHub, agrupadas en SWE-bench Verified, las familias Claude Mythos 5 y GPT-5.6 Sol resuelven entre el 60 y el 65 por ciento de los problemas planteados en un único intento. La medición exige al modelo editar archivos, compilar código y pasar pruebas unitarias sin asistencia.

El rendimiento en benchmarks estáticos ya no predice la estabilidad de un modelo en flujos de producción industrial.

La distancia frente a los desarrollos de pesos abiertos se ha estrechado en el último trimestre. El modelo GLM-5.3 de Zhipu y las variantes recientes de Moonshot alcanzan el 54 por ciento en la misma prueba de ingeniería, según datos de TechCrunch.

Hacia auditorías con datos privados

Frente a la contaminación frecuente de los conjuntos públicos de evaluación, los equipos de investigación adoptan comparaciones pareadas sobre entornos cerrados de clientes corporativos, según consignó The Batch. Esta metodología evalúa el costo por tarea completada y la tasa de alucinaciones en flujos de trabajo prolongados.

Los laboratorios reconocen que la saturación de los exámenes de opción múltiple obliga a reformular las model cards hacia métricas operativas de agentes, donde la coordinación de herramientas y la verificación formal sustituyen a la memoria enciclopédica.