搜索关键词 Gemini Live
AI & Enterprise
Google发布Gemini 3.5语音模型:可在打断后继续对话,Transcribe覆盖85种语言
Google更新语音模型产品线,推出Gemini 3.5 Live、Gemini 3.5 Live Experimental和语音转写模型Gemini 3.5 Transcribe。新模型提升了对话中断处理能力,并带来多语混合识别、实时视觉理解和工具调用等能力;其中,Gemini 3.5 Transcribe覆盖85种语言,语音到文本输出耗时较Chirp 3缩短约70%,实时语音识别错误率降至5.5%。
AI & Enterprise
Google Gemini回应“8天前做的鸡肉沙拉还能吃吗”:按食品安全指南建议丢弃
生成式AI正从搜索、办公场景延伸至日常生活判断。一名用户借助Google Gemini Live询问8天前做的鸡肉沙拉是否还能食用,Gemini在提示相关信息不能替代专业医疗建议后,依据“冷藏一般保存3至4天”的通用食品安全指南,判断食用存在风险并建议丢弃。最终,该用户改吃花生酱果酱三明治。
AI & Enterprise
语音智能体竞争升温,韩国初创公司加快布局
语音AI正从传统TTS迈向可实时对话、理解情绪并执行任务的“语音智能体”,技术路径也在由多阶段流程加速转向一体化实时语音模型。随着OpenAI、Google、Amazon、Apple等科技巨头持续加码,韩国初创公司也在加快布局:Humelo推出DIVE引擎,Neosapience则完成165亿韩元Pre-IPO融资。