Kakao于4日宣布,已升级自研全模态人工智能(AI)模型“Kanana-o”的语音生成功能。
Kakao当天在技术博客中表示,用户只需用自然语言下达语音风格指令,AI便可在生成语音时对语速、音量、音高、情绪、语调和强弱等要素进行控制。
除普通文本朗读外,该模型还能理解并执行更复杂的指令,例如“用快速而悲伤的声音读出来”或“像体育解说一样播报”,也支持基于角色设定的表达方式。Kakao称,Kanana-o虽主要基于韩语数据训练,但在英语语音生成任务中同样能够遵循相同的发声指令。
在用于评估语音指令执行能力的韩语基准测试“InstructTTSEval”中,Kanana-o获得94.50分,高于OpenAI的“GPT-4o-mini-tts”(91.10分),与Google的“Gemini-2.5-Flash-Preview-tts”(95.38分)表现接近。
为提升语音生成速度与效率,Kakao此次还引入了自研语音分词器“LM-SPT”。该技术可减少AI处理的数据量,并以更少的token表示语音信息,从而提高生成速度和整体效率。
Kakao表示,与Mimi、DualCodec、CozyVoice2等采用国际最新技术路线的模型相比,LM-SPT在多项指标上表现更优。公司还计划继续推进语音理解与语音生成统一架构的相关研究,并进一步开发生成笑声、叹息、感叹等非语言表达的技术。
Kakao Unified Foundation Model成果负责人Byeongseok Noh表示,此次Kanana-o语音技术升级的重点在于提升“像人一样自然”的生成能力,同时增强模型按自然语言指令表达用户所需语气、情绪和语调的能力。未来,Kakao将把Kanana-o应用于更多服务场景,提供更自然、更便捷的AI语音体验。