Kakao表示,已升级Kanana-o的语音生成功能,可按自然语言指令控制语气、情绪和语调,并通过自研语音分词器提升生成速度与效率。

Kakao于4日宣布,已升级自研全模态人工智能(AI)模型“Kanana-o”的语音生成功能。

Kakao当天在技术博客中表示,用户只需用自然语言下达语音风格指令,AI便可在生成语音时对语速、音量、音高、情绪、语调和强弱等要素进行控制。

除普通文本朗读外,该模型还能理解并执行更复杂的指令,例如“用快速而悲伤的声音读出来”或“像体育解说一样播报”,也支持基于角色设定的表达方式。Kakao称,Kanana-o虽主要基于韩语数据训练,但在英语语音生成任务中同样能够遵循相同的发声指令。

在用于评估语音指令执行能力的韩语基准测试“InstructTTSEval”中,Kanana-o获得94.50分,高于OpenAI的“GPT-4o-mini-tts”(91.10分),与Google的“Gemini-2.5-Flash-Preview-tts”(95.38分)表现接近。

为提升语音生成速度与效率,Kakao此次还引入了自研语音分词器“LM-SPT”。该技术可减少AI处理的数据量,并以更少的token表示语音信息,从而提高生成速度和整体效率。

Kakao表示,与Mimi、DualCodec、CozyVoice2等采用国际最新技术路线的模型相比,LM-SPT在多项指标上表现更优。公司还计划继续推进语音理解与语音生成统一架构的相关研究,并进一步开发生成笑声、叹息、感叹等非语言表达的技术。

Kakao Unified Foundation Model成果负责人Byeongseok Noh表示,此次Kanana-o语音技术升级的重点在于提升“像人一样自然”的生成能力,同时增强模型按自然语言指令表达用户所需语气、情绪和语调的能力。未来,Kakao将把Kanana-o应用于更多服务场景,提供更自然、更便捷的AI语音体验。

关键词

#Kakao #Kanana-o #语音生成 #TTS #LM-SPT #语音分词器 #InstructTTSEval #全模态人工智能模型
版权所有 © DigitalToday。未经授权禁止转载或传播。