Publicidad

Meta presenta una IA que transcribe conversaciones en tiempo real y distingue más de 20 voces

Meta ha presentado Muse Voice Transcribe, un modelo de inteligencia artificial diseñado para transcribir audio en tiempo real, identificar quién habla en cada momento y gestionar las pausas de una conversación. El sistema, desarrollado por el equipo de Superinteligencia de la compañía, ya está disponible mediante una API y llegará también al dictado de Meta AI para Mac.

La tecnología pretende resolver uno de los problemas más complejos de la transcripción automática: convertir en texto una conversación con varias personas, interrupciones, silencios y cambios de idioma. Según Meta, Muse Voice Transcribe puede distinguir más de 20 hablantes diferentes dentro de una misma grabación, incluso cuando intervienen de forma alterna o se solapan parcialmente.

Transcripción en directo con identificación de hablantes

El nuevo modelo es el primer sistema de percepción en tiempo real desarrollado por Meta. En este contexto, la percepción hace referencia a la capacidad de una IA para interpretar información que recibe de forma continua, como audio, imágenes o vídeo, sin esperar a que termine todo el contenido.

Una de sus funciones principales es la diarización de hablantes, el proceso que permite separar una conversación por personas. En lugar de generar un bloque de texto indiferenciado, el sistema puede asociar cada intervención con el participante correspondiente y seguir los cambios de voz a lo largo de la grabación.

Esta capacidad puede resultar especialmente útil para reuniones, entrevistas, clases, llamadas de atención al cliente y herramientas de accesibilidad. También facilita la creación de actas automáticas y resúmenes cuando participan numerosos interlocutores.

Más de 70 idiomas y conversaciones bilingües

Muse Voice Transcribe ha sido entrenado con datos de más de 70 idiomas. De ellos, 25 han pasado por un proceso de validación exhaustivo antes del lanzamiento, según la compañía. La cobertura lingüística permite utilizar el sistema en un mayor número de mercados y afrontar conversaciones en las que se mezclan varias lenguas.

Meta asegura que el modelo también está preparado para los cambios de idioma dentro de una misma intervención. Esto incluye situaciones habituales entre hablantes bilingües, que pueden pasar de una lengua a otra a mitad de una frase sin realizar una pausa clara.

La identificación automática del idioma y el reconocimiento de estos cambios son tareas especialmente exigentes para una IA de voz. El sistema debe interpretar simultáneamente la pronunciación, el contexto y las características acústicas de cada persona sin introducir retrasos excesivos.

El audio se analiza en bloques de 80 milisegundos

Desde el punto de vista técnico, Muse Voice Transcribe procesa el sonido en fragmentos de 80 milisegundos. Esto equivale a 12,5 bloques por segundo. Cada segmento se transforma en un token, una unidad de información que el modelo utiliza para analizar el audio y decidir qué texto debe generar.

El sistema funciona de forma autorregresiva. Es decir, cada nueva predicción tiene en cuenta la información anterior para construir la transcripción paso a paso. En cada bloque de audio, la IA decide si puede emitir una palabra inmediatamente o si necesita esperar a recibir más sonido para interpretar correctamente la frase.

Esta estrategia busca equilibrar rapidez y precisión. Las palabras sencillas pueden aparecer casi al instante, mientras que los términos ambiguos o las frases con varias interpretaciones requieren más contexto. Para ajustar ese comportamiento, los ingenieros han utilizado entrenamiento por refuerzo, una técnica que optimiza el modelo mediante un sistema de recompensas.

En este caso, la recompensa combina dos objetivos: reducir los errores de transcripción y limitar el tiempo de espera. De este modo, el modelo no tiene que elegir entre ser rápido o ser preciso, sino encontrar un punto de equilibrio dependiendo de la dificultad de cada fragmento.

También reconoce los silencios y admite audios de más de una hora

Otra característica destacada es su capacidad para gestionar las pausas. Cuando el audio se detiene, un token especial informa al modelo de que no está entrando más información. Muse Voice Transcribe puede utilizar esa señal para liberar el texto que estuviera pendiente de confirmar, en lugar de mantenerlo en espera de forma indefinida.

Meta denomina a este comportamiento escucha flexible. La función se aplica tanto a la generación de texto como a la identificación del hablante activo. Además, el modelo puede trabajar con grabaciones de más de una hora sin requerir un procesamiento adicional específico.

Resultados frente a otros modelos de voz

En las pruebas comunicadas por Meta, Muse Voice Transcribe alcanza una tasa de error de palabras del 3,1 % en inglés. Esta métrica, conocida como WER por sus siglas en inglés, calcula el porcentaje de palabras que el sistema transcribe de forma incorrecta, incluyendo omisiones, sustituciones o términos añadidos.

La compañía afirma que ese resultado supera a GPT Live Transcribe y Gemini Transcribe Live. En la identificación de hablantes, el modelo registra una tasa de error del 17,5 %, el dato más bajo entre los sistemas de transcripción populares según la comparativa de Meta. Estas cifras corresponden a las pruebas realizadas por la empresa y pueden variar según el ruido, los acentos, la calidad del micrófono o el número de personas que hablen a la vez.

Disponible mediante API y en Meta AI para Mac

Muse Voice Transcribe ya puede utilizarse a través de una API, una interfaz que permite a los desarrolladores integrar sus funciones en aplicaciones y servicios propios. El precio anunciado es de 3 dólares por cada 1.000 minutos de audio procesado.

Meta no tiene previsto publicar los pesos abiertos del modelo. Los pesos son los parámetros internos que determinan cómo funciona una IA y permiten ejecutar o adaptar el sistema sin depender directamente de los servidores del proveedor.

El modelo también está disponible en el dictado de Meta AI para Mac y en Muse Code. En el ordenador, basta con pulsar la tecla Fn y empezar a hablar para utilizar la función de dictado en cualquier aplicación compatible, según explica la compañía.

Artículo anteriorAarau bajo lupa tras el tiroteo en un rave suizo
Artículo siguienteAnthropic presenta Claude Mythos 5.1 y Fable 5.1 más baratos