Meta于9月1日(当地时间)发布实时语音识别模型Muse Voice Transcribe,主打实时转写与说话人区分能力。该模型可处理20名以上说话人参与的对话,并支持韩语在内的多语言及混合语种场景。
Muse Voice Transcribe是Meta Superintelligence Labs(MSL)推出的首个实时音频识别模型,隶属于多模态推理模型Muse Spark系列,为一款自回归模型。Meta表示,该模型通过单一架构即可完成实时自动语音识别(ASR)、说话人区分和语音结束检测。
在技术实现上,Muse Voice Transcribe以80毫秒为单位处理音频,并引入自适应延迟机制。也就是说,模型会根据识别难度动态决定是继续接收更多音频,还是立即输出文本,以在识别准确率和响应速度之间取得平衡。Meta称,在Artificial Analysis的流式语音识别评测中,该模型的最终词错误率(WER)为3.1%,截至9月1日位居第一。
价格方面,Meta也强调了Muse Voice Transcribe的竞争力。通过Meta Model API调用该模型,按语音时长计费为每小时0.18美元,或每1000分钟3美元。在Artificial Analysis纳入对比的主流实时语音识别模型中,这一定价处于较低水平。
Meta介绍称,该模型基于70多种语言的数据完成训练,其中韩语、英语、日语、中文、西班牙语等25种语言经过了更广泛的验证。Muse Voice Transcribe原生支持代码切换,既可识别同一句中的多语混用,也支持在不同句子之间切换语言。此外,用户还可预先输入特定语言、关键词和上下文信息,以提升识别准确率。
对于时长超过1小时的音频,以及20名以上说话人参与的对话,Muse Voice Transcribe也可在无需额外后处理的情况下完成转写。Meta预计,该模型可应用于会议纪要、采访、授课、呼叫中心等多说话人场景。
目前,Muse Voice Transcribe已可通过Meta Model API、Mac版Meta AI以及AI编码工具Muse Code使用。在Mac设备上,用户按住Fn键说话后,也可在其他应用中直接使用语音输入功能。