OpenAI ha presentado GPT-Live, una nueva generación de modelos de voz con arquitectura full-duplex que permite a ChatGPT escuchar y hablar simultáneamente. El resultado es una conversación mucho más natural, sin los incómodos silencios y cortes del anterior modo de voz.
La noticia
El 8 de julio de 2026, OpenAI lanzó GPT-Live-1 y GPT-Live-1 mini, dos modelos de voz que sustituyen al Advanced Voice Mode en ChatGPT. A partir de hoy, al pulsar el botón de voz en ChatGPT, los usuarios de las versiones Free, Plus y Pro obtendrán una experiencia mejorada impulsada por estos nuevos modelos.
La clave está en su arquitectura full-duplex: en lugar de procesar turnos de forma secuencial (escuchar, procesar, responder, esperar), GPT-Live procesa audio de entrada mientras genera audio de salida de forma continua. Esto permite que el modelo decida en cada instante si hablar, escuchar, hacer una pausa o interrumpir, imitando el flujo natural de una conversación entre personas.
Más de 150 millones de personas usan cada semana las funciones de voz y dictado en ChatGPT. Con este lanzamiento, OpenAI apuesta por la voz como la interfaz principal para interactuar con la inteligencia artificial en tareas cotidianas y, a largo plazo, en trabajos complejos y autónomos.
Cómo funciona
GPT-Live representa un salto arquitectónico respecto a las generaciones anteriores de voz en ChatGPT:
Modelos en cascada (2023). El ChatGPT Voice original encadenaba tres modelos: uno de reconocimiento de voz para transcribir lo que decías, un modelo de lenguaje para generar la respuesta, y otro de texto a voz para convertirla en audio. El resultado era lento y perdía información entre cada paso.
Modelos por turnos (2024). Advanced Voice Mode unificó audio y texto en un solo modelo, pero seguía funcionando por turnos: el modelo esperaba a que dejaras de hablar para responder. Cualquier pausa o ruido de fondo podía interpretarse como el final de tu turno, causando interrupciones en momentos inoportunos.
GPT-Live (2026). La nueva arquitectura elimina el concepto de turno. El modelo procesa entrada y salida de forma continua, tomando decisiones de interacción muchas veces por segundo. Si necesitas un momento para pensar, GPT-Live espera en silencio. Si le pides que se calle y escuche, lo hace. Y si hay ruido de fondo, se centra en tu voz.
Además, cuando necesita información que no tiene —una búsqueda en internet, un razonamiento complejo o una tarea que requiere herramientas— delega la tarea a modelos como GPT-5.5 en segundo plano mientras sigue manteniendo la conversación.
Qué significa para el usuario
Para quien usa ChatGPT a diario, el cambio es notable. Las conversaciones con voz ahora se sienten mucho más reales: puedes interrumpir para hacer una pregunta, el modelo asiente con "mhm" o "vale" para mostrar que sigue el hilo, y si te quedas pensando, espera sin interrumpir.
GPT-Live también incluye respuestas visuales: mientras hablas, ChatGPT puede mostrar tarjetas con información sobre el tiempo, deportes, bolsa o mapas, combinando la inmediatez de la voz con la claridad de lo visual.
OpenAI ha puesto especial cuidado en la seguridad. El modelo incluye salvaguardas que pueden actuar mientras habla, redirigiendo la conversación si detecta contenido de riesgo. Para menores, hay protecciones adicionales y los padres pueden controlar el uso de la voz mediante controles parentales.
Eso sí, no es perfecto. En las primeras pruebas, el modelo muestra limitaciones con idiomas menos comunes y el acento en algunas lenguas sigue siendo forzado. OpenAI promete mejoras progresivas.
El contexto competitivo
GPT-Live llega en un momento de efervescencia en la IA de voz. Apple ha actualizado Siri en iOS 27 para que sea más expresiva, Amazon ha renovado Alexa con IA conversacional, y startups como Sesame, fundada por cofundadores de Oculus, han lanzado asistentes con conversación natural.
OpenAI, sin embargo, parte con ventaja: su base instalada de cientos de millones de usuarios y la integración con GPT-5.5 le permiten ofrecer no solo una voz natural, sino también inteligencia de primer nivel en las respuestas.