ChatGPT开始在语音对话中启用新模型“GPT-Live”,进一步提升实时语音交流的自然度。科技媒体Engadget于8月9日(当地时间)报道称,该模型采用“边听边说”的全双工架构。
在早期语音模式下,ChatGPT需要先后经过语音转写、语言模型处理和语音合成三个环节。此后推出的高级语音模式改为单一多模态模型,整体使用体验已有所提升。
目前,ChatGPT在语音对话场景中使用的正是GPT-Live。OpenAI将其定义为“全双工”架构。此前的语音模型有时会把用户短暂停顿误判为发言结束,导致用户尚未说完,系统便提前作出回应。
GPT-Live的目标之一,就是减少这类情况。用户说话过程中,ChatGPT还可以不时给出“嗯”“对”等简短反馈,使对话节奏更接近日常交流。
对于需要推理或信息检索的复杂问题,系统则会切换至其他模型处理。报道称,GPT-Live可在后台将相关请求交由GPT-5.5等模型完成。不过,生成式AI在能力、准确性和响应速度持续提升的同时,其回答仍不能被视为绝对可靠的信息来源。
除语音能力更新外,ChatGPT还新增了一项与文本呈现相关的功能:不仅可以改写回答内容,也能改变文字外观。科技媒体TechRadar称,用户无需额外安装字体文件,即可借助Unicode字符样式生成装饰文本。
这一功能并非传统意义上的“更换字体”,而是由ChatGPT将原句转换为对应的Unicode字符形式。用户在新对话中输入文案后,可以指定气泡风、哥特风、倒置字符等样式。相比笼统地要求“换一种字体”,直接说明“使用特定Unicode样式”通常更容易得到接近预期的结果。
该功能也可用于调整短句的整体氛围。例如在生日祝福、派对邀请、年末问候或社交平台发文等场景中,同样的内容可以呈现出不同观感。ChatGPT生成后的文本也可复制粘贴到其他应用中继续使用。
不过,这项功能也存在一定限制。基于Unicode的文本,只有在支持相关字符集的环境中才能正常显示。虽然多数新应用不会有太大问题,但在部分网站上,仍可能出现空白方块或被替换为其他符号的情况。此外,装饰性较强的样式也可能降低可读性,并影响屏幕朗读器等无障碍工具的使用效果。
因此,这类装饰文本更适合用于标题或短句强调。ChatGPT虽然也能对长文本进行整体转换,但一旦篇幅过长,实用性和可读性都会下降。TechRadar认为,这项功能并非显著提升生产效率的工具,但可用于让社交平台内容、祝福信息和邀请文本更加醒目。
从此次更新可以看出,ChatGPT的语音交互正从单纯的“朗读式回应”,进一步走向更接近真实交流的节奏控制;与此同时,生成式AI的能力边界也在从内容生成延伸至表达形式的调整。