搜索关键词 ASR
AI & Enterprise
Meta发布实时语音识别模型Muse Voice Transcribe:可转写20名以上说话人对话,支持多语混说
Meta于9月1日发布实时语音识别模型Muse Voice Transcribe,可在实时转写过程中区分不同说话人,适用于20名以上说话人参与的对话以及多语言、混合语种场景。该模型以80毫秒为单位处理音频,并采用自适应延迟技术。Meta称,其在Artificial Analysis流式语音识别评测中的最终词错误率(WER)为3.1%,API按语音时长计费为每小时0.18美元。
AI & Enterprise
OpenAI与Anthropic加速布局AI代理,下一代模型竞争升温
围绕可自主执行任务的AI代理,头部厂商正加快产品迭代。Anthropic为Claude Code和Claude Cowork新增直接操作用户电脑、自动模式等能力,OpenAI则为Codex引入插件支持,进一步拓展企业协作场景。与此同时,OpenAI与Anthropic的下一代模型进展相继浮出水面,OpenRouter数据还显示,中国AI模型自今年2月起Token消耗量已超过美国竞争对手。
AI & Enterprise
Cohere推出开源ASR模型Transcribe:2亿参数,可在消费级GPU运行
企业级AI公司Cohere推出开源自动语音识别模型Transcribe。该模型参数规模为2亿,可在消费级GPU上运行,支持英语、法语、德语、意大利语等14种语言。Cohere表示,Transcribe在Hugging Face开源ASR排行榜上的平均词错误率(WER)为5.42,后续还将整合至企业级AI平台North,并以免费API形式向外部提供。