SAN FRANCISCO, 9 de julio de 2026. OpenAI lanzó el 8 de julio GPT-Live, una arquitectura de voz full-duplex para ChatGPT que escucha y habla al mismo tiempo. El cambio reemplaza Advanced Voice Mode como experiencia de voz por defecto y mueve la interacción desde el turno cerrado, parecido a un walkie-talkie, hacia una conversación donde el usuario puede interrumpir, pausar o pedir más detalle sin esperar el final de una respuesta. Para las preguntas difíciles, OpenAI dice que GPT-Live deriva trabajo a GPT-5.5 en segundo plano y devuelve el resultado dentro del mismo intercambio.
El cambio técnico
El punto técnico es concreto. Un sistema full-duplex puede recibir y emitir audio de forma simultánea. En ChatGPT, según OpenAI el 8 de julio de 2026, eso permite que el modelo decida muchas veces por segundo si debe hablar, escuchar, callar, interrumpir o activar otra herramienta. También habilita backchannels, señales breves como "mhmm" o "got it", y traducción en vivo. TechCrunch reportó el 8 de julio de 2026 el mismo rasgo central: los nuevos modelos pueden hablar y escuchar al mismo tiempo.
La novedad: la voz deja de tratar cada frase como un turno terminado.
Modelos y despliegue
OpenAI presentó el 8 de julio de 2026 dos modelos. GPT-Live-1 será el modo por defecto para usuarios Go, Plus y Pro. GPT-Live-1 mini será el modo por defecto para usuarios Free y reemplaza Advanced Voice Mode en ese nivel. La empresa informó que el despliegue inicial es global en iOS, Android y web, pero no incluye Business, Enterprise ni Edu al lanzamiento.
| Modelo | Plan por defecto | Consulta difícil | Disponibilidad inicial |
|---|---|---|---|
| GPT-Live-1 | Go, Plus y Pro | Delega a GPT-5.5 cuando requiere búsqueda, razonamiento o trabajo más complejo | iOS, Android y web |
| GPT-Live-1 mini | Free | Usa la misma arquitectura de conversación y puede apoyarse en GPT-5.5, según OpenAI | iOS, Android y web |
El carril de fondo
Ese carril de fondo importa porque separa tareas que antes competían por el mismo turno: sostener el ritmo de la conversación y resolver una consulta más pesada. OpenAI describe a GPT-Live como la capa que mantiene la interacción continua, con GPT-5.5 como modelo de fondo para búsqueda, razonamiento o trabajo de mayor complejidad. En una conversación de voz, la consecuencia práctica es que el asistente puede seguir el hilo verbal y, al mismo tiempo, esperar la respuesta de GPT-5.5.

La comparación con Advanced Voice Mode marca el límite anterior. OpenAI explicó el 8 de julio de 2026 que los sistemas de voz en cascada encadenaban tres piezas: reconocimiento de habla, modelo de lenguaje y síntesis de voz. Advanced Voice Mode redujo esa separación porque procesaba y generaba audio dentro de un modelo, pero seguía sujeto a turnos discretos. Si el usuario hacía una pausa, el sistema podía interpretar silencio como final de turno. Si el usuario interrumpía, la conversación tendía a romper el ritmo.
GPT-Live cambia esa regla de control. OpenAI afirma que el modelo puede escuchar mejor en presencia de ruido de fondo, esperar si el usuario pide silencio y mostrar tarjetas visuales para respuestas como clima, deportes o acciones. OpenAI dijo el 8 de julio de 2026 que remasterizó las nueve voces de ChatGPT para el nuevo modo. Esos detalles no prueban por sí solos una mejora medible fuera de sus pruebas internas, pero ubican el lanzamiento en una dirección clara: la voz deja de ser un accesorio del chat escrito y pasa a ser una interfaz primaria.
Según OpenAI el 8 de julio de 2026, más de 150 millones de personas usan cada semana funciones de Voice y Dictation en ChatGPT. Atty Eleti, líder de producto de ChatGPT Voice, describió la voz como "a kind of primary interface to computing... to manage increasingly complex long-running agentic work". La frase resume la ambición del producto: que una conversación hablada pueda coordinar tareas más largas sin exigir al usuario que traduzca todo a texto, comandos o botones.
Lo pendiente
Quedan límites. OpenAI no abrió el acceso por API el 8 de julio de 2026; dejó un registro de interés y dijo que llegará pronto. El nuevo modo tampoco soporta voz con video o pantalla compartida en ChatGPT al lanzamiento, aunque la compañía afirma que trabaja en esas capacidades. Para los planes de trabajo y educación, Business, Enterprise y Edu, el punto operativo es más simple: GPT-Live no entra en el primer despliegue.
El cambio que habrá que medir fuera del anuncio es cuánto resiste la conversación cuando una tarea de fondo tarda, falla o devuelve una respuesta parcial. La arquitectura ya define el nuevo contrato: la voz conversa en primer plano, GPT-5.5 resuelve por detrás, y el usuario no queda obligado a esperar el cierre artificial de cada turno.

