Kakao nâng cấp công nghệ tạo giọng nói cho Kanana-o, cho phép điều khiển cách thể hiện giọng nói và cảm xúc bằng ngôn ngữ tự nhiên. Ảnh: Kakao

Kakao ngày 4/8 cho biết đã nâng cấp công nghệ tạo giọng nói cho Kanana-o, mô hình AI đa phương thức do công ty tự phát triển. Bản nâng cấp cho phép người dùng điều khiển cách thể hiện giọng nói bằng ngôn ngữ tự nhiên, đồng thời cải thiện tốc độ và hiệu suất xử lý.

Theo bài viết đăng cùng ngày trên blog công nghệ của Kakao, người dùng có thể đưa ra chỉ dẫn tự nhiên về cách nói và hệ thống sẽ tạo giọng nói phản ánh các yếu tố như tốc độ, âm lượng, cao độ, cảm xúc, ngữ điệu và mức độ nhấn.

Mô hình không chỉ đọc văn bản đơn thuần mà còn có thể xử lý các yêu cầu phức hợp và thể hiện theo vai trò, chẳng hạn như “đọc nhanh bằng giọng buồn” hoặc “đọc như bình luận thể thao”. Dù chủ yếu được huấn luyện trên dữ liệu tiếng Hàn, mô hình vẫn có thể áp dụng các chỉ dẫn tương tự khi tạo giọng nói tiếng Anh.

Trong InstructTTSEval, bộ benchmark tiếng Hàn dùng để đánh giá khả năng tuân theo chỉ dẫn trong tác vụ tạo giọng nói, mô hình đạt 94,50 điểm. Mức này cao hơn GPT-4o-mini-tts của OpenAI với 91,10 điểm và tiệm cận Gemini-2.5-Flash-Preview-tts của Google với 95,38 điểm.

Để tăng tốc và nâng hiệu suất tạo giọng nói, Kakao đã áp dụng LM-SPT, bộ tokenizer giọng nói do công ty tự phát triển. Công nghệ này mã hóa giọng nói với số lượng token ít hơn, qua đó giảm khối lượng dữ liệu mà mô hình AI phải xử lý.

Kakao cho biết LM-SPT cho kết quả tốt hơn so với một số mô hình ứng dụng công nghệ mới trên thế giới như Mimi, DualCodec và CosyVoice2. Trong thời gian tới, công ty sẽ tiếp tục nghiên cứu kiến trúc tích hợp có thể đồng thời xử lý khả năng hiểu và tạo giọng nói, đồng thời phát triển thêm công nghệ tạo các biểu đạt phi ngôn ngữ như tiếng cười, tiếng thở dài và tiếng cảm thán.

Ông Noh Byung-seok, người đứng đầu nhóm kết quả mô hình nền tảng hợp nhất tại Kakao, cho biết đợt nâng cấp lần này tập trung vào việc tạo ra giọng nói tự nhiên hơn, gần với cách con người nói, đồng thời thể hiện được phong cách, cảm xúc và ngữ điệu theo chỉ dẫn ngôn ngữ tự nhiên của người dùng. Theo ông, Kakao sẽ đưa Kanana-o vào nhiều dịch vụ hơn để mang lại trải nghiệm AI giọng nói tự nhiên và thuận tiện hơn.

Từ khóa

#Kakao #Kanana-o #AI #tạo giọng nói #TTS #LM-SPT #InstructTTSEval
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.