Microsoft amplió su oferta de modelos de inteligencia artificial para voz con el lanzamiento de MAI-Transcribe-2-Streaming, una herramienta de reconocimiento de voz diseñada para producir texto mientras la persona aún está hablando. La presentación incluye además MAI-Voice-2.1 y MAI-Voice-2.1-Flash, dos modelos de texto a voz que la empresa plantea como componentes para asistentes, sistemas de atención al cliente y aplicaciones multilingües.
De acuerdo con Microsoft AI, MAI-Transcribe-2-Streaming admite 60 idiomas y detecta de manera automática y continua la lengua que se está utilizando. A diferencia de los sistemas que devuelven la transcripción una vez terminada una frase o intervención, el modelo entrega resultados provisionales —denominados partials— poco después de recibir el audio y los actualiza a medida que incorpora más contexto. La compañía sostiene que la primera hipótesis aparece en poco más de 100 milisegundos y que ese mecanismo permite a una aplicación empezar a interpretar una solicitud o activar herramientas antes de que el interlocutor concluya la oración.
En el ranking AA-WER Streaming de Artificial Analysis, el modelo registró una tasa de error por palabra de 2,5% tanto en transcripciones finales como en las primeras transcripciones parciales. En la medición citada por la plataforma, la respuesta final llega alrededor de 0,13 segundos después de terminar el habla. Artificial Analysis ubicó a MAI-Transcribe-2-Streaming por delante de Grok Voice Transcribe 2.0, que obtuvo 2,7% de error con 0,49 segundos de latencia, y de Muse Voice Transcribe, con 3,1% y 0,16 segundos, respectivamente.
La disponibilidad comercial del modelo parte de un precio introductorio de 0,54 dólares por hora de audio hasta el final del año, equivalente a 9 dólares por cada 1.000 minutos. Esa cifra lo sitúa en el mismo nivel que Gemini 3.5 Transcribe Live, según la comparación publicada por Artificial Analysis, aunque por encima de los 6,50 dólares por 1.000 minutos atribuidos a ElevenLabs Scribe v2 Realtime y Deepgram Flux. En paralelo, OpenAI lista para su modelo GPT-Live-Transcribe una tarifa de 0,017 dólares por minuto, o 17 dólares por 1.000 minutos, lo que muestra que el costo, la latencia y la precisión se mantienen como variables de competencia en el segmento de transcripción de audio en vivo.
En síntesis de voz, Microsoft anunció MAI-Voice-2.1, compatible con 23 idiomas y 26 variantes regionales. La empresa asegura que una misma voz puede conservar su identidad al cambiar de idioma, ajustando la pronunciación al acento local. El modelo tiene un precio de 22 dólares por millón de caracteres. Su variante MAI-Voice-2.1-Flash mantiene la misma cobertura lingüística y está dirigida a flujos de mayor volumen o sensibles a la latencia: Microsoft informa que puede generar 45 segundos de audio con una latencia total de 150 milisegundos y fija su precio en 15 dólares por millón de caracteres.
Ambos modelos de voz permiten clonación a partir de unos segundos de audio de referencia y, según la compañía, incluyen mecanismos de consentimiento para limitar usos indebidos. Microsoft indicó que los tres modelos estarán disponibles mediante Microsoft Foundry, MAI Playground y otros socios, mientras que Azure mantiene servicios de reconocimiento de voz para transcripción en tiempo real, por lotes e integración con aplicaciones conversacionales.
Fuente: Microsoft | Editado por CDOL

































