搜索关键词 语音模型
AI & Enterprise
OpenAI发布GPT-Live-1 API:支持实时插话与边听边说
OpenAI面向开发者推出实时语音对话模型GPT-Live-1 API,主打可在通话过程中实现插话、轮替发言等更自然的交互体验。该模型基于全双工架构,可降低语音对话延迟并减少多模型之间信息传递带来的不稳定性;复杂推理与工具调用则可交由GPT-6 Astra等后端模型承担。其语音前端定价为0.05美元/分钟。
AI & Enterprise
Google发布Gemini 3.5语音模型:可在打断后继续对话,Transcribe覆盖85种语言
Google更新语音模型产品线,推出Gemini 3.5 Live、Gemini 3.5 Live Experimental和语音转写模型Gemini 3.5 Transcribe。新模型提升了对话中断处理能力,并带来多语混合识别、实时视觉理解和工具调用等能力;其中,Gemini 3.5 Transcribe覆盖85种语言,语音到文本输出耗时较Chirp 3缩短约70%,实时语音识别错误率降至5.5%。
Telecommunications & Media
SK Telecom通过韩国自主AI基础模型第二阶段评估,加速布局多模态与AI Agent
SK Telecom已通过韩国政府“自主AI基础模型”项目第二阶段评估。公司表示,将以A.X K2为核心,推进多模态和AI Agent能力建设,并推动模型在制造、国防等场景落地。按规划,后续型号K3将向万亿级参数迈进;韩国科学技术信息通信部也计划将NVIDIA B200 GPU支持规模由约768块扩大至约1000块。
-
AI & Enterprise
ChatGPT上线“GPT-Live”,实时语音对话更自然
-
AI & Enterprise
Krafton开源语音AI基础模型“A.X K2 Raon-Speech”,发力游戏角色语音交互
-
AI & Enterprise
SK Telecom发布6880亿参数自研模型A.X K2,加快产业场景落地
-
AI & Enterprise
OpenAI为ChatGPT桌面版上线语音操控功能,可执行电脑任务
-
AI & Enterprise
OpenAI为ChatGPT语音模型推出GPT-Live:支持实时双向对话和视觉卡片
-
AI & Enterprise
OpenAI升级ChatGPT Voice,推出新语音模型GPT-Live
-
AI & Enterprise
据《纽约时报》:OpenAI收购AI语音克隆公司Weights.gg
-
AI & Enterprise
Meta、Google加码个人AI代理,企业级治理平台竞争升温
-
AI & Enterprise
OpenAI推出3款实时语音模型,覆盖对话、翻译和转写
-
AI & Enterprise
Zscaler与OpenAI合作,将安全专用AI模型纳入安全平台
-
AI & Enterprise
微软发布3款自研AI模型,以更激进的定价抢占市场
-
AI & Enterprise
Krafton发布AI模型品牌Raon,四款基础模型在Hugging Face开源
-
AI & Enterprise
Cohere推出开源ASR模型Transcribe:2亿参数,可在消费级GPU运行
-
AI & Enterprise
Mistral开源文本转语音模型Voxtral TTS:支持9种语言,可运行于边缘设备
-
AI & Enterprise
Fireworks AI收购Hathora,强化超低时延AI推理基础设施