Google发布Gemini 3.5 Live新模型。图片来源:Google

Google更新了语音模型产品线,推出Gemini 3.5 Live、面向开发者的Gemini 3.5 Live Experimental,以及语音转写模型Gemini 3.5 Transcribe。

据TechRadar等外媒当地时间26日报道,Gemini 3.5 Live较Gemini 3.1 Live明显提升了对话过程中对用户打断的处理能力,并新增实时视觉信息处理、多语混合识别和工具调用等功能。此前,Gemini Live无法调用其他工具,此次更新后,其可覆盖的使用场景进一步扩大。

在旧版本中,Gemini Live在语音识别和对话衔接方面存在不少问题。例如,部分场景下会误识别用户所用语言并自动切换;一旦用户插话,还可能造成对话衔接紊乱,甚至从用户选定的语音回退至默认语音。Google表示,Gemini 3.5 Live有望缓解上述问题。

与之同时发布的Gemini 3.5 Transcribe,则是用于替代现有语音转写模型Chirp 3的新版本。Google称,该模型从语音输入到最终文本输出的耗时较Chirp 3缩短约70%,实时语音识别错误率降至5.5%。虽然相比Chirp 3的7.32%并非大幅跃升,但预计可减少用户输入过程中频繁手动修正的负担。

Gemini 3.5 Transcribe的升级不止体现在识别准确率上。该模型可自动过滤“嗯”“呃”等口头填充词;在用户口误后自行更正时,系统也能实时改写文本;同时还可参考用户预先设置的自定义词表,自动处理专业术语。上述能力覆盖85种语言;对于预先录制的音频,模型最多可区分并识别3名说话者。

不过,由于AI会基于用户意图对文本进行自动润色,最终生成的文字内容可能与实际发言存在差异,这也被视为该模型的一项局限。对于短句中的口吃或不自然表达,系统可以更顺畅地进行整理,但其改写机制未必适用于所有场景。

目前,Gemini 3.5 Transcribe已在部分产品中落地。Android版Gboard的Rambler功能已采用该模型,可将冗长语音整理为更规范的文本,并自动删除口头填充词。该功能目前仅支持Pixel 11机型,Google表示,计划年内扩展至“更多搭载Gemini智能功能的设备”。

此外,自当天起,macOS版Gemini应用也开始将该模型用于语音输入,并可结合屏幕识别,通过语音命令完成本地文件摘要、跨应用移动文本,以及在光标位置生成图像等操作。

开发者支持范围也在扩大。编码工具Antigravity自当天起在获得用户同意后,支持调用Gemini 3.5 Transcribe,并可结合屏幕上下文和对话记录使用该模型。AI Studio的构建功能同样接入了该模型,使仅通过语音完成应用开发的“vibe coding”成为可能。开发者还可通过Gemini API访问该模型。

Google还表示,计划在不久后将这一能力引入Chrome浏览器。届时,用户可在网页端任意文本输入框中使用语音输入,包括回复邮件、发布社交媒体内容,以及输入AI聊天机器人的提示词等。

此次发布的三款模型分别为Gemini 3.5 Live、Gemini 3.5 Live Experimental和Gemini 3.5 Transcribe。其中,Gemini 3.5 Live Experimental的特点是,在处理复杂推理任务时可实时分步骤解释推理进展。三款模型将优先以英文向所有macOS版Gemini应用用户,以及部分国家和语言地区的Android版Rambler用户开放;面向开发者,则通过AI Studio与Antigravity,并通过Gemini API以公开预览形式提供。

截至目前,Google尚未单独披露面向全部用户的推送时间,但预计将在数日内陆续推进。此次发布之际,Google此前预告将于6月推出的Gemini 3.5 Pro仍未正式上线。

关键词

#Google #Gemini Live #Gemini 3.5 Live #Gemini 3.5 Transcribe #语音转写 #多语识别 #Gemini API #Gboard #Chrome
版权所有 © DigitalToday。未经授权禁止转载或传播。