SAN FRANCISCO, 30 de julio de 2026. Sam Altman anunció el jueves en su cuenta de X un recorte de precios para dos de los tres modelos de la familia GPT-5.6: GPT-5.6 Luna, el más chico y rápido, baja 80%, y GPT-5.6 Terra, el intermedio, baja 20%. "Queremos ofrecer la mejor relación precio/inteligencia en cada nivel", escribió Altman.

Luna pasa de 1 a 0,20 dólares por millón de tokens de entrada y de 6 a 1,20 dólares por millón de tokens de salida. Terra pasa de 2,50 a 2 dólares de entrada y de 15 a 12 dólares de salida, por millón de tokens en ambos casos. El modelo insignia de la familia, GPT-5.6 Sol, no cambió de precio, pero sumó un modo Fast en la API: hasta 2,5 veces más velocidad al doble de costo, con la misma inteligencia declarada.

El mecanismo detrás del recorte

Según OpenAI, el ahorro vino de un trabajo que la compañía le encargó al propio Sol: con Codex, su asistente de programación, el modelo reescribió y optimizó de forma autónoma los kernels de producción (el código que ejecuta las operaciones matemáticas del modelo) en Triton y Gluon, dos lenguajes de programación de GPU de código abierto que mantiene OpenAI. Esa reescritura redujo en 20% el costo de servir el modelo de punta a punta.

Sol reescribió y optimizó de forma autónoma el código que ejecuta sus propias operaciones matemáticas, y esa reescritura redujo en 20% el costo de servir el modelo.

Por separado, Sol rediseñó su propio modelo de borrador de decodificación especulativa (una técnica que usa un modelo chico para anticipar tokens que el modelo principal verifica en paralelo, en lugar de generarlos uno por uno) a través de cientos de experimentos autónomos. La compañía sostiene que esa reescritura elevó en más de 15% la eficiencia de generación de tokens. Para validar que el código que escribió el propio modelo fuera correcto, OpenAI dice haber usado FpSan (Floating-Point Sanitizer), una herramienta de verificación de código abierto. Son cifras que reporta la propia compañía, sin auditoría externa que las confirme.

El fin del "tokenmaxxing"

Modelo Entrada antes Entrada ahora Salida antes Salida ahora
Luna US$1,00 US$0,20 US$6,00 US$1,20
Terra US$2,50 US$2,00 US$15,00 US$12,00

Precio por millón de tokens.

El recorte llega en lo que la cobertura especializada describe como el fin del "tokenmaxxing": la fase en que las empresas alentaban a su personal a usar la mayor cantidad de inteligencia artificial posible sin mirar el costo, y que ahora cede lugar a una demanda explícita de retorno medible sobre lo que gastan en estos modelos.

Frente a DeepSeek, la ventaja depende del pedido

Con el nuevo precio, Luna cuesta 0,20 dólares por millón de tokens de entrada y 1,20 por millón de salida, con una ventana de contexto de 1,05 millones de tokens. El modelo chino DeepSeek V4 Flash cobra 0,14 dólares de entrada y 0,28 de salida por millón, con una ventana de un millón de tokens; DeepSeek V4 Pro cobra 0,435 y 0,87 dólares respectivamente.

La comparación se invierte según el tamaño del pedido. Por encima de los 272.000 tokens en una misma consulta, Luna duplica el costo de entrada y multiplica por 1,5 el de salida, mientras los precios de DeepSeek no cambian con la longitud. Para un pedido de 900.000 tokens de entrada, ese recargo deja a Luna por encima de los dos modelos chinos: V4 Pro costaría 0,4785 dólares y V4 Flash, 0,154 dólares.

Lo que sigue

OpenAI no dijo si extenderá el recorte a Sol ni si el ahorro de Triton y Gluon se aplicará a otros modelos de la familia. Tampoco hay, todavía, una medición independiente que confirme el 20% de reducción de costo de servicio ni el 15% de eficiencia adicional que la compañía se atribuye.