OpenAI已发布实时语音对话模型GPT-Live-1 API,面向语音代理开发者开放使用。与传统语音AI需等待用户说完后再作答不同,GPT-Live-1支持在对话过程中实时插话,并可实现更自然的轮替发言。
据Gigazine当地时间11日报道,OpenAI自10日起已向开发者提供GPT-Live-1 API。开发者可围绕语气、语速、对话方式以及回复节奏等参数进行更细致的设置。
GPT-Live-1的核心在于全双工(full duplex)架构。不同于传统“语音转文本—语言模型处理—语音合成”的串联链路,GPT-Live-1可在同一模型中同步处理输入与输出语音。即使用户在AI回答过程中临时打断或补充信息,系统也能维持对话连续性。
OpenAI表示,这一设计有助于降低语音交互延迟,并减少多模型之间信息传递带来的不稳定性。同时,模型在处理环境噪声、沉默区间以及长时对话上下文保持方面也更加自然。
在开发层面,GPT-Live-1强调可定制性。开发者可通过系统提示设定语速、语调和对话风格,并选择支持多语言及方言的语音方案。
对于复杂任务,OpenAI采用前后端分工方式:GPT-Live-1负责实时语音交互,推理或工具调用则交由GPT-6 Astra等文本模型,或外部模型处理。按这一架构,面向餐厅预订、客服等实际电话服务场景的AI代理,落地门槛有望进一步降低。
在性能方面,OpenAI称GPT-Live-1较现有语音模型有所提升。公司表示,与此前的语音模型GPT-Realtime-2.1相比,GPT-Live-1在全双工基准测试中的表现提升30%,轮替发言延迟和交互质量也有所改善;在与GPT-6 Astra结合的语音代理任务评估中,按“Tau3”标准排名第一。
目前已有企业开始导入该模型。为住宅和医疗机构提供AI解决方案的EliseAI,作为早期设计合作伙伴,已将GPT-Live-1应用于实际运营环境。
定价方面,GPT-Live-1语音前端按分钟计费,价格为0.05美元/分钟。开发者可在此基础上搭配后端模型及所需代理能力,构建面向不同服务场景的语音AI应用。
Gigazine认为,此次API发布意味着OpenAI正把原本局限于ChatGPT内部的实时语音能力,进一步扩展至客服、预订、电话咨询等外部服务场景。相较于“必须等用户说完”的传统语音AI,这种支持双向对话、可实时插话的自然交互形态,是否会成为下一代服务入口,仍值得观察。
目前,GPT-Live-1 API已正式开放。OpenAI表示,开发者可将类似ChatGPT的自然对话体验引入自有应用,构建可边听边说的语音代理,并按需组合模型与工具。