Meta ha presentado Muse Voice Transcribe, un nuevo modelo de voz en tiempo real multilingüe que detecta la voz, incluso de varios hablantes, para realizar una transcripción precisa.
Muse Voice Transcribe ha sido desarrollado por Meta Superintelligence Labs y se presenta como un modelo multimodal autorregresivo de la familia Muse Spark.
Ofrece reconocimiento automático de voz en tiempo real, y para ello, procesa el audio en fragmentos de 80 ms (12,5 Hz) y lo hace con una técnica llamada retraso adaptativo, ajusta el retraso que introduce para predecir la siguiente palabra de manera dinámica, según...