Muse Voice Transcribe, mô hình phiên âm giọng nói theo thời gian thực của Meta. Ảnh: Meta

Meta ngày 1/9 (giờ địa phương) đã công bố Muse Voice Transcribe, mô hình AI chuyển lời nói thành văn bản theo thời gian thực, đồng thời có thể tách người nói. Điểm đáng chú ý của sản phẩm là khả năng xử lý hội thoại với hơn 20 người tham gia, hỗ trợ nhiều ngôn ngữ, trong đó có tiếng Hàn, và nhận diện cả các cuộc trò chuyện đan xen nhiều ngôn ngữ.

Theo Meta, đây là mô hình phiên âm giọng nói theo thời gian thực đầu tiên do Meta Superintelligence Labs (MSL) phát triển. Muse Voice Transcribe là mô hình tự hồi quy thuộc dòng mô hình suy luận đa phương thức Muse Spark, tích hợp trong một hệ thống duy nhất các tác vụ nhận dạng giọng nói tự động (ASR) theo thời gian thực, tách người nói và phát hiện điểm kết thúc phát ngôn.

Mô hình xử lý âm thanh theo từng khung 80 mili giây (ms). Meta cho biết đã áp dụng cơ chế độ trễ thích ứng, cho phép hệ thống tự quyết định nên tiếp tục thu thêm ngữ cảnh hay xuất văn bản ngay, tùy theo độ khó của từ, nhằm cân bằng giữa độ chính xác và tốc độ phản hồi.

Trong bài đánh giá ASR dạng streaming của Artificial Analysis, Meta cho biết mô hình đạt tỷ lệ lỗi từ (WER) 3,1% ở bản chép cuối và xếp đầu bảng tại thời điểm công bố.

Meta cũng nhấn mạnh lợi thế về chi phí. Mức giá trên Meta Model API là 0,18 USD cho mỗi giờ âm thanh, tương đương 3 USD cho 1.000 phút. Theo Meta, đây là mức giá thuộc nhóm thấp trong số các mô hình nhận dạng giọng nói thời gian thực quy mô lớn được Artificial Analysis so sánh.

Muse Voice Transcribe được huấn luyện trên hơn 70 ngôn ngữ. Trong số này, 25 ngôn ngữ như tiếng Hàn, tiếng Anh, tiếng Nhật, tiếng Trung và tiếng Tây Ban Nha đã được kiểm chứng trên diện rộng.

Mô hình cũng hỗ trợ sẵn code-switching, cho phép trộn nhiều ngôn ngữ trong cùng một câu hoặc chuyển ngôn ngữ giữa các câu. Ngoài ra, người dùng có thể khai báo trước ngôn ngữ, từ khóa và thông tin ngữ cảnh để tăng độ chính xác nhận diện.

Theo Meta, Muse Voice Transcribe có thể xử lý các tệp âm thanh dài hơn một giờ và hội thoại với hơn 20 người nói mà không cần hậu xử lý. Công cụ này được kỳ vọng sẽ phù hợp cho biên bản cuộc họp, phỏng vấn, bài giảng, tổng đài và các môi trường có nhiều người tham gia.

Hiện Muse Voice Transcribe được cung cấp qua Meta Model API, Meta AI trên macOS và công cụ AI hỗ trợ lập trình Muse Code. Trên máy Mac, người dùng có thể nhấn giữ phím Fn khi nói để sử dụng tính năng nhập liệu bằng giọng nói ngay trong các ứng dụng khác.

Từ khóa

#Meta #Muse Voice Transcribe #ASR #trí tuệ nhân tạo #phiên âm giọng nói #Meta Model API
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.