OpenAI y Cerebras Systems presentaron el 13 de agosto Ultrafast, un nuevo nivel de servicio en la API que corre GPT-5.6 Sol, el modelo insignia de OpenAI, a 750 tokens de salida por segundo, hasta 14 veces más rápido que el procesamiento estándar. Según OpenAI, Ultrafast corre exactamente el mismo modelo que la versión estándar, sin recortes de capacidad a cambio de la velocidad.

GPT-5.6 Sol encabeza la familia GPT-5.6 de OpenAI, que también incluye a Terra, de rendimiento equilibrado, y Luna, la variante económica. Ultrafast se ofrece por ahora solo sobre Sol.

Cómo lo logra Cerebras

La velocidad viene del hardware, no de un recorte al modelo. Los chips Wafer-Scale Engine de Cerebras guardan 44 gigabytes de memoria SRAM directamente en un chip del tamaño de una oblea completa, lo que mantiene los pesos del modelo dentro del chip en lugar de moverlos constantemente entre la memoria interna y la externa. Ese movimiento de datos es, según Cerebras, el cuello de botella que limita la velocidad de inferencia en los sistemas basados en GPU cuando el modelo es grande. Con los pesos ya en el chip, el flujo de tokens se canaliza entre obleas sin interrupción.

Rohan Varma, de OpenAI, describió el resultado como una IA "que se mantiene al ritmo de cómo pensás, programás y colaborás". El investigador de OpenAI Jeffrey Wang lo puso en términos de uso diario: la tarea "ahora termina antes de que tenga la oportunidad de cambiar de contexto".

Los números, medidos por la propia Cerebras

En Humanity's Last Exam, un examen de 2.500 preguntas, GPT-5.6 Sol en Ultrafast contestó el total en 11 horas y 11 minutos. Claude Fable 5 necesitó 78 horas y 27 minutos para un conjunto comparable, según la misma medición.

Cerebras reporta a Ultrafast 11 veces más rápido que Claude Fable 5 y 5 veces más rápido que Opus 4.8 en su modo Fast.

En GDP-Val, un banco de pruebas de trabajo de conocimiento con valor económico, la aceleración de punta a punta llega a 5,6 veces frente al procesamiento estándar, sin pérdida de calidad, siempre según la empresa. Las tres mediciones las corrió Cerebras en julio de 2026, sin verificación de un tercero independiente, un límite habitual en este tipo de comparaciones publicadas por el propio proveedor.

Para qué sirve, y qué falta confirmar

OpenAI y Cerebras señalan casos donde la latencia decide si una herramienta sirve o no: respuesta a incidentes, investigación financiera, atención al cliente en tiempo real y ciclos de investigación que antes corrían de un día para el otro y ahora caben en una sesión de trabajo.

Ultrafast lanza en vista previa limitada, con lista de espera, para un grupo selecto de clientes de la API; el acceso se ampliará a medida que crezca la capacidad, sin fecha de disponibilidad general. OpenAI tampoco publicó una tarifa propia para Ultrafast: la referencia disponible es la de GPT-5.6 Sol estándar, 5 dólares por millón de tokens de entrada y 30 por millón de salida, un número que la propia compañía advierte que no debe asumirse como el precio del nuevo nivel.