搜索关键词 实时语音
AI & Enterprise
OpenAI发布GPT-Live-1 API:支持实时插话与边听边说
OpenAI面向开发者推出实时语音对话模型GPT-Live-1 API,主打可在通话过程中实现插话、轮替发言等更自然的交互体验。该模型基于全双工架构,可降低语音对话延迟并减少多模型之间信息传递带来的不稳定性;复杂推理与工具调用则可交由GPT-6 Astra等后端模型承担。其语音前端定价为0.05美元/分钟。
AI & Enterprise
Meta发布实时语音识别模型Muse Voice Transcribe:可转写20名以上说话人对话,支持多语混说
Meta于9月1日发布实时语音识别模型Muse Voice Transcribe,可在实时转写过程中区分不同说话人,适用于20名以上说话人参与的对话以及多语言、混合语种场景。该模型以80毫秒为单位处理音频,并采用自适应延迟技术。Meta称,其在Artificial Analysis流式语音识别评测中的最终词错误率(WER)为3.1%,API按语音时长计费为每小时0.18美元。
AI & Enterprise
Google发布Gemini 3.5语音模型:可在打断后继续对话,Transcribe覆盖85种语言
Google更新语音模型产品线,推出Gemini 3.5 Live、Gemini 3.5 Live Experimental和语音转写模型Gemini 3.5 Transcribe。新模型提升了对话中断处理能力,并带来多语混合识别、实时视觉理解和工具调用等能力;其中,Gemini 3.5 Transcribe覆盖85种语言,语音到文本输出耗时较Chirp 3缩短约70%,实时语音识别错误率降至5.5%。
-
AI & Enterprise
Google与OpenAI加速超高速AI竞赛:Gemini 3.7 Flash对阵GPT-5.6 Sol Ultrafast
-
AI & Enterprise
ChatGPT上线“GPT-Live”,实时语音对话更自然
-
AI & Enterprise
AI价格战升级:DeepSeek低价模型搅动市场,OpenAI跟进降价
-
AI & Enterprise
PolyAI发布实时语音对话模型Dialog-RSN-1:无需转写,响应瞄准300毫秒内
-
AI & Enterprise
Krafton开源语音AI基础模型“A.X K2 Raon-Speech”,发力游戏角色语音交互
-
Telecommunications & Media
LG Uplus加码AI代理“ixiO”:从通话扩至日常场景,布局物理AI
-
AI & Enterprise
OpenAI为ChatGPT语音模型推出GPT-Live:支持实时双向对话和视觉卡片
-
AI & Enterprise
OpenAI升级ChatGPT Voice,推出新语音模型GPT-Live
-
Games & Commerce
Naver地图上线步行实时导航:支持耳机语音引导
-
AI & Enterprise
DeepL收购Mixhalo团队和技术,发力大型活动实时翻译场景
-
Games & Commerce
LINE Games加码PC布局,《CODE EXIT》试玩版登顶Epic“Top Demo”
-
Games & Commerce
LINE Games公布PC合作恐怖游戏《Code Exit》试玩版
-
Industry
Samsung Electronics升级Galaxy Watch与Samsung Health,强化跑步与健康管理功能
-
AI & Enterprise
欧盟将高风险AI监管延后至2027年底,数字主权再受考验
-
AI & Enterprise
Google发布Gemma 4开放权重模型,可在低功耗设备端本地运行复杂推理