搜索关键词 实时语音识别
AI & Enterprise
Meta发布实时语音识别模型Muse Voice Transcribe:可转写20名以上说话人对话,支持多语混说
Meta于9月1日发布实时语音识别模型Muse Voice Transcribe,可在实时转写过程中区分不同说话人,适用于20名以上说话人参与的对话以及多语言、混合语种场景。该模型以80毫秒为单位处理音频,并采用自适应延迟技术。Meta称,其在Artificial Analysis流式语音识别评测中的最终词错误率(WER)为3.1%,API按语音时长计费为每小时0.18美元。
AI & Enterprise
Google发布Gemini 3.5语音模型:可在打断后继续对话,Transcribe覆盖85种语言
Google更新语音模型产品线,推出Gemini 3.5 Live、Gemini 3.5 Live Experimental和语音转写模型Gemini 3.5 Transcribe。新模型提升了对话中断处理能力,并带来多语混合识别、实时视觉理解和工具调用等能力;其中,Gemini 3.5 Transcribe覆盖85种语言,语音到文本输出耗时较Chirp 3缩短约70%,实时语音识别错误率降至5.5%。
AI & Enterprise
全球网络安全并购升温:浏览器安全成焦点,AI加速迈向世界模型
全球网络安全行业并购持续升温,Zscaler收购SquareX、Sophos收购Arco Cyber等交易,显示浏览器安全、AI驱动防护和身份安全正成为行业关注重点。与此同时,AI行业正从大语言模型加快迈向世界模型,Alibaba公开RynnBrain,Runway完成3.15亿美元融资。OpenAI宣布在ChatGPT免费版和ChatGPT Go引入广告,Databricks则以1340亿美元估值完成50亿美元融资。