此次API发布显示,OpenAI正尝试将自然语音交互与后端推理能力拆分开来并协同调用。图片来源:Gigazine

OpenAI已发布实时语音对话模型GPT-Live-1 API,面向语音代理开发者开放使用。与传统语音AI需等待用户说完后再作答不同,GPT-Live-1支持在对话过程中实时插话,并可实现更自然的轮替发言。

据Gigazine当地时间11日报道,OpenAI自10日起已向开发者提供GPT-Live-1 API。开发者可围绕语气、语速、对话方式以及回复节奏等参数进行更细致的设置。

GPT-Live-1的核心在于全双工(full duplex)架构。不同于传统“语音转文本—语言模型处理—语音合成”的串联链路,GPT-Live-1可在同一模型中同步处理输入与输出语音。即使用户在AI回答过程中临时打断或补充信息,系统也能维持对话连续性。

OpenAI表示,这一设计有助于降低语音交互延迟,并减少多模型之间信息传递带来的不稳定性。同时,模型在处理环境噪声、沉默区间以及长时对话上下文保持方面也更加自然。

在开发层面,GPT-Live-1强调可定制性。开发者可通过系统提示设定语速、语调和对话风格,并选择支持多语言及方言的语音方案。

对于复杂任务,OpenAI采用前后端分工方式:GPT-Live-1负责实时语音交互,推理或工具调用则交由GPT-6 Astra等文本模型,或外部模型处理。按这一架构,面向餐厅预订、客服等实际电话服务场景的AI代理,落地门槛有望进一步降低。

在性能方面,OpenAI称GPT-Live-1较现有语音模型有所提升。公司表示,与此前的语音模型GPT-Realtime-2.1相比,GPT-Live-1在全双工基准测试中的表现提升30%,轮替发言延迟和交互质量也有所改善;在与GPT-6 Astra结合的语音代理任务评估中,按“Tau3”标准排名第一。

目前已有企业开始导入该模型。为住宅和医疗机构提供AI解决方案的EliseAI,作为早期设计合作伙伴,已将GPT-Live-1应用于实际运营环境。

定价方面,GPT-Live-1语音前端按分钟计费,价格为0.05美元/分钟。开发者可在此基础上搭配后端模型及所需代理能力,构建面向不同服务场景的语音AI应用。

Gigazine认为,此次API发布意味着OpenAI正把原本局限于ChatGPT内部的实时语音能力,进一步扩展至客服、预订、电话咨询等外部服务场景。相较于“必须等用户说完”的传统语音AI,这种支持双向对话、可实时插话的自然交互形态,是否会成为下一代服务入口,仍值得观察。

目前,GPT-Live-1 API已正式开放。OpenAI表示,开发者可将类似ChatGPT的自然对话体验引入自有应用,构建可边听边说的语音代理,并按需组合模型与工具。

关键词

#OpenAI #GPT-Live-1 #实时语音 #全双工 #语音代理 #GPT-6 Astra #API #客服
版权所有 © DigitalToday。未经授权禁止转载或传播。