搜索关键词 自动语音识别
AI & Enterprise
Meta发布实时语音识别模型Muse Voice Transcribe:可转写20名以上说话人对话,支持多语混说
Meta于9月1日发布实时语音识别模型Muse Voice Transcribe,可在实时转写过程中区分不同说话人,适用于20名以上说话人参与的对话以及多语言、混合语种场景。该模型以80毫秒为单位处理音频,并采用自适应延迟技术。Meta称,其在Artificial Analysis流式语音识别评测中的最终词错误率(WER)为3.1%,API按语音时长计费为每小时0.18美元。
AI & Enterprise
Google在iOS平台推出离线AI听写应用“Google AI Edge Eloquent”
Google已面向iOS平台免费推出离线AI听写应用“Google AI Edge Eloquent”。该应用基于Gemma自动语音识别模型,可在iPhone本地实时完成语音转写,并在暂停后自动过滤口头语、润色文本;启用云端模式后,还可调用Gemini模型进行文本整理。
AI & Enterprise
OpenAI与Anthropic加速布局AI代理,下一代模型竞争升温
围绕可自主执行任务的AI代理,头部厂商正加快产品迭代。Anthropic为Claude Code和Claude Cowork新增直接操作用户电脑、自动模式等能力,OpenAI则为Codex引入插件支持,进一步拓展企业协作场景。与此同时,OpenAI与Anthropic的下一代模型进展相继浮出水面,OpenRouter数据还显示,中国AI模型自今年2月起Token消耗量已超过美国竞争对手。