Microsoft标志。图片来源:Shutterstock

Microsoft发布3款语音AI模型,包括一款流式转写模型和两款语音合成模型。

据外媒SiliconANGLE当地时间10月2日报道,此次发布的核心产品是Microsoft首款流式转写模型MAI-Transcribe-2-Streaming。该模型可将语音实时转换为文本,在语音输入过程中持续更新转写结果,并在发言结束后输出最终文本。

报道称,这一模型可用于实时字幕等场景,也适合在用户发言尚未结束时提前启动请求处理流程的应用。

MAI-Transcribe-2-Streaming平均可在320毫秒内返回首个转写候选结果,支持60多种语言,并可自动识别输入语言。其定价为每小时音频收费0.54美元。

此次一并发布的两款语音合成模型分别为MAI-Voice-2.1和MAI-Voice-2.1-Flash。其中,MAI-Voice-2.1侧重表现力和音质,MAI-Voice-2.1-Flash则以部分性能为代价,换取更快的响应速度和更低的使用成本。两款模型均支持23种语言。

Microsoft上月还推出了非流式版本MAI-Transcribe-2,定价为每小时音频0.10美元,价格约为流式版本的五分之一。报道指出,流式模型需要在音频输入过程中持续返回中间结果,因此计算和处理负担更高。

报道认为,此次发布也是Microsoft推进自研模型战略的一部分。SiliconANGLE称,Microsoft AI首席执行官Mustafa Suleyman今年7月曾表示,在市场对OpenAI和Anthropic高性能模型成本上升的担忧加剧之际,公司将进一步强化MAI模型体系,并计划将自研模型应用于Excel、Outlook等平台的Copilot代理。

关键词

#Microsoft #语音AI #流式转写 #语音转写 #MAI-Transcribe-2-Streaming #MAI-Voice-2.1 #MAI-Voice-2.1-Flash #语音合成 #Copilot
版权所有 © DigitalToday。未经授权禁止转载或传播。