IA y modelos
OpenAI lanza los modelos de voz GPT-Live-1 para ChatGPT
OpenAI lanzó GPT-Live-1 y GPT-Live-1 mini, nuevos modelos conversacionales full-duplex que reemplazan de forma predeterminada al Modo de Voz Avanzado de ChatGPT.
OpenAI lanzó hoy dos nuevos modelos conversacionales, GPT-Live-1 y GPT-Live-1 mini, y afirmó que suenan más naturales y manejan mejor los turnos de conversación que antes. Ambos son modelos full-duplex —es decir, que pueden hablar y escuchar al mismo tiempo—, lo que permite a los usuarios interrumpir de forma natural a mitad de la conversación y habilita funciones como la traducción en vivo. OpenAI está reemplazando de forma predeterminada el actual Modo de Voz Avanzado de ChatGPT con GPT-Live-1 mini.
El nuevo modo de voz dirige las consultas a los modelos de texto más avanzados de OpenAI, como GPT-5.5, para tareas de búsqueda, razonamiento o capacidades agénticas —la capacidad de realizar tareas complejas, autónomas y de larga duración— mientras la conversación continúa. También está diseñado para sesiones más largas: el líder de producto de ChatGPT Voice, Atty Eleti, dijo que ha tenido conversaciones de 30 a 40 minutos con la función durante sus caminatas. Debido a que el modo se basa en modelos GPT más nuevos, puede presentar algunas respuestas de forma visual, lo que coloca a OpenAI en el mismo camino que empresas emergentes como Monogram, que recaudó USD 40 millones en financiamiento semilla de DST y Lux Capital para desarrollar asistentes más interactivos y con capacidad de respuesta visual. Como lo expresó Eleti: “Con el tiempo, creemos que esto también desbloqueará la capacidad de usar la voz como una especie de interfaz principal para la informática, y para gestionar un trabajo agéntico de larga duración cada vez más complejo. El tipo de casos de uso increíbles que vemos que la gente logra utilizando Codex y ChatGPT, creemos que la voz puede ser la interfaz del futuro para todo tipo de trabajo”.
OpenAI ve que la voz se está convirtiendo en una interfaz principal para la informática, partiendo de una base en la que más de 150 millones de personas ya hablan con ChatGPT a través de sus funciones de Voz y Dictado. Diversos reportes han sugerido que OpenAI podría lanzar un par de audífonos con capacidades de inteligencia artificial (IA) este año, aunque la empresa no dio detalles sobre ningún plan de hardware. Sus rivales se están moviendo en la misma dirección: tanto Apple como Amazon han actualizado sus asistentes para que sean más conversacionales, y Sesame (una startup de asistentes de IA), cofundada por el cofundador de Oculus, Brendan Iribe, y Ankit Kumar, ha lanzado asistentes diseñados en torno a la conversación natural mientras completan tareas en segundo plano.
OpenAI señaló que el nuevo modo de voz está optimizado para la mayoría de los idiomas hablados, aunque no especificó cuáles. Los modelos incluyen salvaguardas integradas para dar respuestas adecuadas para su edad a los adolescentes y proporcionar recursos si la conversación se desvía hacia temas como la autolesión. Los límites aún son visibles: en una demostración de traducción en vivo en hindi, el asistente habló con un marcado acento estadounidense y utilizó frases que sonaban poco naturales y propias de un libro.
Por qué importa
OpenAI está posicionando la voz full-duplex como la futura interfaz principal para la informática compleja y las tareas agénticas, yendo más allá de los asistentes de voz simples hacia una productividad de larga duración y manos libres.