Noticias IA de ACIAPR

Noticias de inteligencia artificial curadas con contexto, verificadas con fuentes confiables y más...

Noticias IA · Verificadas

Noticias de inteligencia artificial curadas con contexto, verificadas con fuentes confiables y más...

Explora avances de IA en software, hardware, seguridad, salud y espacio con una experiencia editorial más clara, ágil y pensada para transmitir confianza.

OpenAI cambia la voz de ChatGPT con modelos que escuchan y hablan a la vez
software

OpenAI cambia la voz de ChatGPT con modelos que escuchan y hablan a la vez

OpenAI cambia la voz de ChatGPT con modelos que escuchan y hablan a la vez

OpenAI presentó GPT-Live, una nueva generación de modelos de voz para ChatGPT diseñada para hacer las conversaciones más naturales. La novedad central es que el sistema puede escuchar y hablar al mismo tiempo, lo que permite interrupciones más normales, pausas más largas y usos como traducción en vivo.

Qué ocurrió

OpenAI publicó el 8 de julio la página “Introducing GPT-Live” y describió la actualización como una nueva generación de modelos de voz para interacción humana con IA. Según el resumen oficial en su RSS, GPT-Live ya impulsa ChatGPT Voice y busca conversaciones más naturales.

La cobertura de TechCrunch añade detalles operativos: OpenAI lanzó GPT-Live-1 y GPT-Live-1 mini, modelos full-duplex capaces de escuchar mientras responden. Ese cambio es importante porque la experiencia anterior dependía más de una cadena separada de reconocimiento de voz, modelo de lenguaje y texto a voz. En la práctica, eso podía producir interrupciones incómodas, respuestas fuera de ritmo o dificultad para manejar turnos de conversación.

The Verge reportó que GPT-Live-1 mini reemplazará por defecto la experiencia actual de voz avanzada en ChatGPT, mientras que el modelo GPT-Live-1 más grande estará disponible para usuarios de planes pagos. Search Engine Journal destacó otro punto práctico: la voz puede apoyarse en búsqueda y mostrar información visual mientras la conversación continúa.

Por qué importa

La voz es una de las interfaces donde la IA generativa todavía se siente menos natural que una conversación humana. No basta con que el modelo responda bien; también tiene que saber cuándo callar, cuándo esperar, cuándo permitir una interrupción y cuándo reconocer que el usuario sigue pensando. GPT-Live apunta directamente a ese problema de experiencia de usuario.

Para OpenAI, el lanzamiento también mueve a ChatGPT hacia un asistente menos dependiente del teclado. Si la interacción por voz se vuelve más fluida, el producto puede encajar mejor en tareas móviles, accesibilidad, aprendizaje, soporte, traducción y flujos de trabajo donde escribir no es lo más cómodo.

Qué cambia para usuarios y empresas

Para usuarios, el cambio más visible debería ser una conversación con menos cortes artificiales. Un modelo full-duplex puede permitir que una persona corrija, interrumpa o agregue contexto sin tener que esperar a que el sistema termine una frase completa. Eso puede hacer que la voz sea más útil para practicar idiomas, pedir instrucciones, revisar ideas o resolver dudas en movimiento.

Para empresas, el ángulo relevante es automatización conversacional. Atención al cliente, capacitación, soporte interno y asistentes de campo dependen mucho de turnos de conversación. Si el sistema entiende mejor pausas e interrupciones, puede reducir fricción en escenarios donde la velocidad y la claridad importan.

Contexto de producto

La lectura de Nova Rivera es que GPT-Live no debe verse solo como una mejora cosmética de voz. Es una pieza de interfaz. En la competencia entre asistentes de IA, la experiencia natural —no solo el benchmark— puede decidir qué herramienta se usa todos los días. Aun así, lo confirmado por ahora es el lanzamiento y las capacidades descritas por OpenAI y medios especializados, no una prueba independiente amplia de desempeño en todos los acentos, idiomas o entornos ruidosos.

Qué todavía no está claro

Falta ver cómo se comporta GPT-Live a escala, cuánto mejora en situaciones reales fuera de demos, qué límites tendrá por plan, región o idioma, y cómo manejará privacidad, grabaciones y uso empresarial de audio. También falta evidencia independiente sobre latencia, precisión y seguridad en conversaciones largas.

Fuentes consultadas

OpenAI: Leer Más Leer Más Verge: Leer Más Engine Journal: Leer Más por Nova Rivera — Perspectiva de producto y automatización.

Fuentes: OpenAI, TechCrunch, The Verge, Search Engine Journal