lunes, 3 de agosto de 2026

IA y modelos

OpenAI expande su Realtime API con razonamiento y traducción

OpenAI ha actualizado su Realtime API con nuevas funciones de inteligencia de voz, incluyendo razonamiento de clase GPT-5 y traducción en tiempo real, aunque la empresa señala que estas herramientas podrían ser utilizadas indebidamente.

OpenAI expands Realtime API with reasoning and translation
Foto: OpenAI

OpenAI anunció el jueves que su API ahora incluirá un conjunto de nuevas funciones de inteligencia de voz. El lanzamiento está diseñado para ayudar a los desarrolladores a crear aplicaciones que puedan hablar, transcribir y traducir conversaciones con los usuarios en tiempo real. Esta expansión tiene como objetivo ayudar a los desarrolladores en múltiples sectores, incluyendo servicio al cliente, educación, medios, eventos y plataformas de creadores.

La actualización, que se aloja dentro de la Realtime API de OpenAI, introduce tres capacidades distintas para manejar solicitudes complejas de los usuarios:

  • GPT-Realtime-2: Un modelo de voz creado para generar simulaciones vocales realistas que pueden conversar con los usuarios. A diferencia de su predecesor, este modelo está construido con razonamiento de clase GPT-5, un nivel de rendimiento superior diseñado para manejar solicitudes más complicadas de los usuarios.
  • GPT-Realtime-Translate: Un servicio de traducción conversacional diseñado para proporcionar traducción en tiempo real. La función admite más de 70 idiomas de entrada que el modelo puede comprender, y 13 idiomas de salida que transmite al hablante.
  • GPT-Realtime-Whisper: Una capacidad de transcripción de voz a texto en vivo que ofrece a los usuarios transcripción en tiempo real a medida que ocurren las interacciones.

Según OpenAI, los modelos recién lanzados están diseñados para hacer la transición del audio en tiempo real desde sistemas simples de llamada y respuesta hacia interfaces de voz activas que pueden escuchar, razonar, traducir, transcribir y tomar medidas durante una conversación.

Aunque estas herramientas ofrecen utilidad para las empresas que buscan expandir el servicio al cliente, la educación, los medios, los eventos y las plataformas de creadores, la empresa reconoce que las nuevas funciones podrían ser utilizadas indebidamente. Para abordar estos riesgos, OpenAI ha construido mecanismos de seguridad (guardrails) para evitar que sus nuevas funciones sean abusadas para crear spam, fraude u otras formas de abuso en línea. La empresa ha integrado activadores específicos en el sistema para que “las conversaciones puedan ser detenidas si se detecta que violan nuestras directrices de contenido dañino”, señaló OpenAI.

Por qué importa

Estos modelos desplazan el audio en tiempo real de sistemas simples de llamada y respuesta a interfaces de voz activas capaces de razonar y tomar medidas, ofreciendo una utilidad significativa para los desarrolladores en servicio al cliente, educación y medios.