El desarrollador independiente Ben Davis, cuyo primer test de diez tareas había puesto a Ox Alpha por encima del 80% en DeepSWE, un benchmark de ingeniería de software de largo horizonte, completó después una corrida contra las 113 tareas completas del tablero.
El resultado corregido ronda el 63%, según reportó el 24 de agosto el analista que siguió la corrida en tiempo real, muy por debajo del número inicial que había circulado.
Una segunda medición independiente, de los investigadores identificados como Wenqi y Kevin sobre el mismo set de 113 tareas, llegó a un resultado cercano.
| Corrida | Puntaje de Ox Alpha |
|---|---|
| Muestra de 10 tareas (20 de agosto) | más de 80% |
| Set completo de 113 tareas (24 de agosto) | cerca de 63% |
Esa cifra ubica a Ox Alpha en el mismo rango que GPT-5.6 Sol de gama media y que DeepSeek V4 Pro, y por debajo de Grok 4.6 y Gemini 3.7 Flash, que anotan 65% en el mismo tablero. Diez tareas eran menos del 9% del benchmark completo: la caída refleja el tamaño real de esa primera muestra, demasiado chica para sostener el titular que generó.
La teoría de origen también se movió
TechCrunch reportó que la hipótesis dominante sobre quién construyó Ox Alpha cambió en cuestión de días. La lectura inicial señalaba a la familia GLM de Zhipu AI, la compañía china rebautizada Z.ai. Un análisis posterior sumó como candidato a una versión todavía no publicada de MAI, la familia de modelos de Microsoft. TechCrunch remarca que ningún vínculo, ni con Zhipu ni con Microsoft ni con ningún otro laboratorio, cuenta con procedencia criptográfica o confirmación formal de un fabricante.
Ese vaivén de teorías es distinto de una tercera observación, más difícil de verificar: que el modelo que responde detrás del alias no sea siempre el mismo.
El analista independiente Tim Jayas dijo haber repetido, días después del lanzamiento, un prompt idéntico al que le dio a Ox Alpha el primer día (pedirle un modelo 3D del motor Raptor de SpaceX) y haber recibido una respuesta notablemente más detallada y precisa que la original. De ahí planteó, como hipótesis propia y sin confirmación de ningún proveedor, que distintas variantes de un modelo podrían responder bajo el mismo alias "Ox Alpha", y que la política de retención de datos que declara la ficha de OpenRouter (los prompts y respuestas quedan retenidos pero no se usan para entrenar) sería compatible con esa rotación.
Ninguna de las dos observaciones (la corrección del benchmark y el cambio percibido en las respuestas) prueba lo mismo que la otra. La primera es una medición reproducible con metodología pública. La segunda es la lectura subjetiva de un único usuario sobre un solo prompt, sin control de temperatura ni de versión declarada. El proveedor anónimo no respondió a ninguna de las dos.
La ventana de acceso gratuito sigue abierta. El anuncio de lanzamiento de OpenCode la fijó en torno a una semana desde el 20 de agosto, lo que la lleva a su cierre alrededor del 27. Hasta entonces, cada nueva corrida pública sigue siendo la única fuente de datos sobre un modelo cuyo fabricante todavía no firmó nada.

