Microsoft ha lanzado recientemente el modelo de reconocimiento de voz MAI-Transcribe-2, el cual se presenta como la opción más rápida, precisa y económica del mercado, superando a competidores como OpenAI, Google y ElevenLabs. Con un coste de tan solo 10 centavos por hora de audio, este modelo marca un descenso significativo en comparación con su predecesor, que se ofrecía a 36 centavos por hora. Este cambio implica que para empresas que procesan una cantidad considerable de audio, como bancos o empresas telecomunicaciones, los costes anuales pueden reducirse drásticamente de $36,000 a $10,000, lo que convierte la transcripción en un asunto de menor discusión financiera.
Este lanzamiento destaca una estrategia que Microsoft ha adoptado en los últimos años: el desarrollo de modelos propios de inteligencia artificial que no dependan de otros proveedores. MAI-Transcribe-2 es un claro ejemplo de este enfoque, diseñado específicamente para lidiar con las condiciones complicadas del audio del mundo real, en lugar de las grabaciones en estudio. El modelo es capaz de transcribir audio en 60 idiomas, ha mejorado capacidades como la identificación de hablantes y los marcadores de tiempo a nivel palabra, así como la identificación automática de idiomas, entre otros.
Características y Beneficios para las Empresas
Entre las innovaciones que incorpora, la diacritización del hablante permite diferenciar quién habla en una grabación con múltiples participantes, convirtiendo un muro de texto en una transcripción útil. Además, el modelo ofrece una «configuración de salida» que permite elegir entre una transcripción literal, que incluye todos los errores de habla, y una versión limpia, ideal para notas rápidas. También destaca su capacidad para manejar cambios de idioma en medio de una conversación.
Microsoft sustenta su promesa de rendimiento con tres afirmaciones clave. Primero, MAI-Transcribe-2 se posiciona como el número uno en el benchmark FLEURS con una tasa de error de palabra del 5.2%, lo que, si bien es impresionante, ha aumentado desde el 3.7% de su modelo anterior, lo que sugiere que el promedio abarca una mayor variedad de idiomas. En segundo lugar, el modelo se posiciona en segundo lugar en el leaderboard de Artificial Analysis, destacando su velocidad y eficiencia. Finalmente, Microsoft ha afirmado que es diez veces más rápido que otros modelos populares en el mercado, lo que no solo reduce el tiempo de entrega, sino también los costos operativos.
El Rápido Desarrollo de Microsoft AI
Desde el lanzamiento de MAI-Transcribe-1 en abril, la compañía ha presentado tres modelos en un corto periodo de cinco meses, cada uno mejorando en características y eficiencia. Este ritmo de lanzamiento pone de manifiesto la decisión de Microsoft de hacer que la transcripción sea un servicio más accesible y competitivo en el mercado. Este enfoque también busca desplazar a los modelos de terceros aprovechando su infraestructura en la nube y su experiencia con servicios de voz.
El motivo detrás de esta decisión de construir modelos propios, a pesar de su fuerte inversión en OpenAI, radica en la búsqueda de independencia y reducción de costos. Microsoft ha comenzado a utilizar los modelos MAI en productos como Word y Excel, apuntando a maximizar sus márgenes al reducir pagos a proveedores externos.
Competitividad en el Mercado
En el paisaje competitivo, Microsoft ha orientado su enfoque hacia los laboratorios del frente, donde destaca por ofrecer un modelo de precio más bajo y características que otros competidores suelen ofrecer como complementos costosos. Sin embargo, sigue enfrentándose a especialistas en la transcripción que han dominado el nicho por años, un área donde Microsoft está buscando establecerse con buenos argumentos a su favor.
A medida que el mercado evoluciona, las empresas que necesitan servicios de transcripción deben considerar aspectos como la duración del precio promocional que Microsoft ha anunciado y la especificidad de la precisión del lenguaje en el que trabajan. Con estos elementos en mente, queda claro que MAI-Transcribe-2 no solo representa un avance significativo en el reconocimiento de voz, sino también un cambio potencial en el ecosistema de proveedores de servicios de transcripción.
