搜索关键词 Transcribe
AI & Enterprise
Google在Gmail、Docs和Keep上线Gemini语音交互功能
Google已在Gmail、Google Docs和Google Keep中推出基于Gemini的语音交互功能,用户可通过自然语言提问、语音听写等方式处理邮件、撰写文档和整理备忘录。相关功能分别以Gmail Live、Docs Live和Keep Live上线,当前向Google AI付费订阅用户开放,后续还将扩展至Workspace商业客户。
AI & Enterprise
Meta发布实时语音识别模型Muse Voice Transcribe:可转写20名以上说话人对话,支持多语混说
Meta于9月1日发布实时语音识别模型Muse Voice Transcribe,可在实时转写过程中区分不同说话人,适用于20名以上说话人参与的对话以及多语言、混合语种场景。该模型以80毫秒为单位处理音频,并采用自适应延迟技术。Meta称,其在Artificial Analysis流式语音识别评测中的最终词错误率(WER)为3.1%,API按语音时长计费为每小时0.18美元。
AI & Enterprise
Google发布Gemini 3.5语音模型:可在打断后继续对话,Transcribe覆盖85种语言
Google更新语音模型产品线,推出Gemini 3.5 Live、Gemini 3.5 Live Experimental和语音转写模型Gemini 3.5 Transcribe。新模型提升了对话中断处理能力,并带来多语混合识别、实时视觉理解和工具调用等能力;其中,Gemini 3.5 Transcribe覆盖85种语言,语音到文本输出耗时较Chirp 3缩短约70%,实时语音识别错误率降至5.5%。
-
AI & Enterprise
Google发布手语转文本AI模型SL2T,Pixel 11首发搭载
-
Telecommunications & Media
Google发布Pixel 11系列:起售价899美元,Pixel Tag同步亮相
-
AI & Enterprise
软件企业重构AI定价:从按用量转向按成果收费
-
AI & Enterprise
微软发布3款自研AI模型,以更激进的定价抢占市场
-
AI & Enterprise
OpenAI与Anthropic加速布局AI代理,下一代模型竞争升温
-
AI & Enterprise
Cohere推出开源ASR模型Transcribe:2亿参数,可在消费级GPU运行