搜索关键词 实时语音对话
AI & Enterprise
PolyAI发布实时语音对话模型Dialog-RSN-1:无需转写,响应瞄准300毫秒内
PolyAI推出实时语音对话AI模型Dialog-RSN-1,主打电话通话场景下的低时延与更自然的交互体验。该模型将语音识别与理解整合进模型内部,跳过文本转写环节,直接解析原始语音,以捕捉语调、节奏和上下文信息。PolyAI称,其整体延迟为280至500毫秒,响应时间可控制在300毫秒内。
AI & Enterprise
Krafton开源语音AI基础模型“A.X K2 Raon-Speech”,发力游戏角色语音交互
Krafton宣布在全球AI平台Hugging Face开源语音AI基础模型“A.X K2 Raon-Speech”。该模型结合SK Telecom的小型语言模型“A.X K2”与Krafton自研语音编码器、语音编解码器,可直接完成语音理解与生成,减少情感和语调信息损失。未来,公司计划将相关技术用于提升游戏中的CPC同伴角色实时语音交互能力。
AI & Enterprise
语音智能体竞争升温,韩国初创公司加快布局
语音AI正从传统TTS迈向可实时对话、理解情绪并执行任务的“语音智能体”,技术路径也在由多阶段流程加速转向一体化实时语音模型。随着OpenAI、Google、Amazon、Apple等科技巨头持续加码,韩国初创公司也在加快布局:Humelo推出DIVE引擎,Neosapience则完成165亿韩元Pre-IPO融资。