图片来源:Shutterstock

据SiliconANGLE当地时间30日 报道,PolyAI发布实时语音对话AI模型Dialog-RSN-1,主打电话通话场景下的低时延交互,并强调更接近真人通话的对话节奏与自然度。

传统语音AI通常需要依次完成语音识别、文本生成和语音合成等步骤。与此不同,Dialog-RSN-1将语音识别与理解能力整合进模型内部,仅将语音输出环节保留为独立模块,从而更好地捕捉传统转写流程中容易丢失的语调、说话节奏和对话语境等信息。

Dialog-RSN-1跳过文本转写环节,直接解析原始语音。PolyAI表示,这种方式更有利于处理发音不够清晰的词汇,以及必须结合上下文才能判断的表达。例如,模型可以根据语境识别“Matthew”这类需要逐个拼读字母的情况,也能区分“Audibel”等可能与普通词汇混淆的品牌名称。

在响应速度方面,PolyAI称,Dialog-RSN-1的延迟区间为280至500毫秒,响应时间可控制在300毫秒内。作为对比,OpenAI的GPT Realtime 2.1延迟为860至1900毫秒。

关键词

#PolyAI #Dialog-RSN-1 #实时语音对话 #电话通话场景 #低延迟 #OpenAI #GPT Realtime 2.1
版权所有 © DigitalToday。未经授权禁止转载或传播。