Meta lanza una IA capaz de distinguir 20 voces en una sola grabación
La inteligencia artificial sigue rompiendo barreras en el procesamiento de audio, y esta vez Meta ha dado un paso adelante con una herramienta que promete revolucionar cómo gestionamos las conversaciones grabadas. Su nuevo modelo, diseñado para transcribir voz en tiempo real, no solo convierte el habla en texto, sino que es capaz de distinguir hasta 20 voces diferentes en una misma grabación. Esto significa que, por fin, podremos obtener transcripciones útiles de reuniones caóticas, debates o incluso llamadas con múltiples participantes, algo que hasta ahora parecía ciencia ficción.
Lo más llamativo de esta tecnología es su capacidad para manejar la complejidad del lenguaje natural. No se limita a un solo idioma: ha sido entrenada con más de 70 lenguas, y en 25 de ellas ha superado pruebas exhaustivas antes de su lanzamiento. Pero lo realmente innovador es cómo gestiona los cambios de idioma dentro de una misma frase, algo habitual en hablantes bilingües. Imagina una reunión técnica donde un arquitecto explica un detalle en español y el cliente responde en inglés mezclando términos: la IA de Meta lo transcribirá sin perder el hilo.
Tecnología detrás del "oído" inteligente
El secreto de este avance está en su arquitectura, que procesa el audio en fragmentos mínimos de 80 milisegundos. Para ponerlo en perspectiva, eso equivale a analizar 12,5 segmentos por segundo. En cada uno de estos "trozos" de sonido, la IA decide si transcribe inmediatamente lo escuchado o espera al siguiente fragmento para tener más contexto. Esto le permite manejar palabras ambiguas o frases complejas sin perder precisión. Por ejemplo, si alguien dice "voy a...", la IA puede esperar a que termine la frase ("...revisar el plano") antes de transcribirla, en lugar de cometer errores por apresurarse.
Los resultados son notables: en inglés, el modelo comete solo un 3,1% de errores al transcribir palabras, una cifra que mejora a sus competidores directos. En la identificación de hablantes, aunque el margen de error sube al 17,5%, sigue siendo el más bajo del mercado actual. Además, es capaz de procesar grabaciones de más de una hora sin necesidad de ajustes manuales, liberando el texto pendiente automáticamente cuando detecta el final del audio. Por ahora, la herramienta está disponible en la aplicación de Meta AI para Mac y a través de su API, con un coste de 3 dólares por cada 1.000 minutos de audio procesado.
Qué significa para tu negocio
Si tu pyme trabaja con reuniones frecuentes —ya sean con clientes, proveedores o equipos internos—, esta tecnología puede ahorrarte horas de trabajo manual. Imagina poder grabar una visita a una obra, una reunión de coordinación con contratistas o incluso una llamada con un cliente extranjero y tener al instante una transcripción organizada por hablantes, con los términos técnicos correctamente identificados. Para estudios de arquitectura, empresas de reformas o agencias inmobiliarias, esto significa menos tiempo perdido en tomar notas y más precisión en los seguimientos. Además, al estar disponible en múltiples idiomas, elimina barreras en proyectos internacionales. Eso sí, conviene probarla primero con grabaciones cortas para familiarizarse con su funcionamiento antes de confiar en ella para documentos críticos. La IA de Meta no es perfecta, pero acerca un poco más la oficina del futuro a tu día a día.
Fuente original: Hipertextual
Conversación
Inicia sesión para comentar y reaccionar.
EntrarSé el primero en comentar.