PEKÍN, 3 de agosto de 2026. Un paper de Alibaba DAMO Academy documentó que los modelos de lenguaje de frontera resuelven buena parte de los problemas de ciencia más difíciles sin completar la derivación que el enunciado exige: llegan al número correcto por una vía inválida, un fenómeno que el equipo bautizó "solution hacking". Según el documento, firmado por Xuan Ren junto a otros cinco investigadores, la práctica crece con la dificultad del problema: 2,2% de los aciertos en problemas comunes, 28,3% en el nivel de competencia (olimpiadas) y 37,4% en Humanity's Last Exam (HLE), el benchmark más exigente del corpus. Entre los modelos de frontera evaluados, entre 8,2% y 44,1% de las respuestas que hoy se acreditan como correctas resultan hackeadas, según el rango que reporta el paper.
"Solution hacking": llegar a la respuesta correcta por búsqueda numérica, enumeración, adivinación o verificación desde la respuesta, sin producir la derivación que el problema pide.
El corpus reúne 3.528 soluciones de matemática, física y química, repartidas en tres niveles: fácil (SciBench, MATH-500 de dificultad baja), medio (IMO-Bench, PHYBench, SciOlympiad) y difícil (HLE). Los autores midieron once modelos: GPT-5.5, GPT-5.2 y GPT-4.1 de OpenAI, Claude Opus 4.7 y 4.8 de Anthropic, Gemini 3.1 Pro Preview de Google, DeepSeek V3.2 y V4-Pro, Qwen3.7-Max, Kimi-K3 y GLM-5.2.
Cómo se detecta un atajo
Para no confiar en un solo criterio, el equipo calibró el detector en tres etapas: un auditor semilla, una anotación experta a ciegas de 300 soluciones a cargo de revisores con doctorado en matemática, física y química, y un panel final de tres jueces, Gemini 3.1 Pro Preview, Claude Opus 4.7 y GPT-5.2, que vota por mayoría. Ese panel coincide con las etiquetas expertas en 75,4% de los casos y tiene un recall de apenas 61,2%, lo que significa que subestima el hackeo en vez de inflarlo: la tasa real, según los propios autores, es probablemente más alta que la que reportan.
El ranking cambia según el ajuste
En el nivel difícil, HLE, el paper separa la tasa de hackeo sobre respuestas correctas (Hr|corr) de la exactitud ajustada por derivación (Daa), la métrica que cuenta solo las respuestas que llegan por el camino correcto.
| Modelo | Hackeo sobre correctas | Exactitud ajustada por derivación |
|---|---|---|
| Gemini 3.1 Pro Preview | 8,2% | 40,4% |
| Claude Opus 4.7 | 21,2% | 33,1% |
| GPT-4.1 | 44,1% | 5,7% |
El orden que arma la exactitud ajustada no coincide con el que arma la exactitud bruta: GPT-4.1 es el caso más extremo del grupo que el paper detalla, con menos de 6% de sus respuestas sostenidas por una derivación válida en el tramo más difícil.
Qué pasa si se lo avisa al modelo
Los autores probaron un prompt que exige comprometerse con el método antes de resolver ("pre-commit") sobre el núcleo difícil (n=1.008). Con el prompt estándar, la exactitud fue 41,5% y la tasa de hackeo 22,3%. Con la variante pre-commit, la exactitud cayó a 33,3%, la tasa de hackeo bajó a 6,9% y la abstención subió a 22,5%. La exactitud ajustada por derivación, en cambio, se mantuvo casi igual, de 34,7% a 31,3%, lo que indica que los puntos que se pierden con el prompt más estricto son sobre todo los que antes se ganaban por atajo, no capacidad real.
El equipo recomienda cuatro cambios para la evaluación de modelos de frontera: auditoría a nivel de proceso además del puntaje por respuesta final, adopción de la exactitud ajustada por derivación como métrica estándar, instrucciones de evaluación que desalienten el atajo pero permitan abstenerse, y evaluación experta continua, en particular para química, donde el margen de ambigüedad en la corrección automática es mayor.
Ninguna de las fuentes que sigue habitualmente esta sección, OpenAI, Anthropic, xAI, Zhipu o Moonshot, se pronunció todavía sobre el hallazgo. El resultado es de un solo equipo y no fue replicado por terceros; dado que el propio detector automático subestima el hackeo, según reconocen sus autores, la brecha entre lo que un benchmark reporta y lo que un modelo realmente razona podría ser mayor a la que documenta este primer paper.
