lunes, 3 de agosto de 2026

IA y modelos

Mistral AI lanza Voxtral, un modelo de texto a voz de código abierto

Mistral AI lanzó Voxtral TTS, un modelo de texto a voz de código abierto que admite nueve idiomas y puede adaptar voces personalizadas con menos de cinco segundos de audio.

Mistral AI launches Voxtral, an open source text-to-speech model
Foto: Mistral

El jueves, la empresa francesa de IA Mistral AI lanzó Voxtral TTS, un nuevo modelo de texto a voz de código abierto. El modelo está diseñado para convertir texto en audio hablado, lo que permite a las empresas crear agentes de voz para atención al cliente, ventas y otros casos de uso de interacción. Voxtral TTS admite nueve idiomas y puede adaptarse a una voz personalizada utilizando una muestra de audio de menos de cinco segundos. Según la empresa, el modelo es capaz de capturar características sutiles del habla humana, incluidos acentos, inflexiones, entonaciones e irregularidades en el flujo. Esta capacidad permite al modelo cambiar entre idiomas fácilmente mientras preserva las características únicas de la voz original.

El modelo está construido sobre la arquitectura Ministral 3B y está optimizado para un rendimiento en tiempo real. Cuenta con un tiempo hasta el primer audio (TTFA)—que mide cuándo el modelo comienza a hablar tras recibir una entrada—de 90 ms para una muestra de 10 segundos de 500 caracteres. Además, Voxtral TTS tiene un factor de tiempo real (RTF)—una medida de la velocidad de renderizado en relación con la duración del clip—de 6x. Esto significa que el modelo puede renderizar un clip de 10 segundos en aproximadamente 1.6 segundos. Este renderizado de alta velocidad hace que el modelo sea adecuado para aplicaciones de baja latencia como el doblaje o la traducción en tiempo real sin sonar robótico.

Pierre Stock, vicepresidente de operaciones científicas de Mistral AI, señaló que el modelo fue desarrollado en respuesta a la demanda de los clientes de un modelo de voz que pueda ejecutarse en dispositivos edge, que incluyen hardware como relojes inteligentes, teléfonos inteligentes y computadoras portátiles. “Nuestros clientes han estado pidiendo un modelo de voz. Así que construimos un modelo de voz de tamaño reducido que puede caber en un reloj inteligente, un teléfono inteligente, una computadora portátil u otros dispositivos edge. Su costo es una fracción de cualquier otra cosa en el mercado, pero ofrece un rendimiento de vanguardia”, dijo Stock.

Aunque el lanzamiento actual es un modelo de texto a voz, Mistral AI tiene planes más amplios para su tecnología de voz. Stock declaró que la empresa planea tener una plataforma de extremo a extremo que pueda manejar flujos multimodales de entrada y salida, incluidos audio, texto e imágenes. Según Stock, el beneficio principal de este sistema agéntico de extremo a extremo planificado es que permitirá a los usuarios obtener significativamente más información al admitir audio tanto como entrada como salida.

Por qué importa

El lanzamiento de Voxtral TTS posiciona a Mistral AI para desafiar a proveedores establecidos de IA de voz como ElevenLabs, Deepgram y OpenAI. Al ofrecer una alternativa de código abierto que puede ejecutarse en hardware como relojes inteligentes, teléfonos inteligentes y computadoras portátiles, Mistral AI proporciona a las empresas una opción personalizable para crear agentes de voz.