Microsoft vừa giới thiệu ba mô hình AI giọng nói mới trong dòng MAI, gồm một mô hình phiên âm thời gian thực và hai mô hình tổng hợp giọng nói, hướng tới việc mở rộng năng lực cho các tác nhân AI như Copilot.
Theo SiliconANGLE ngày 2/10 (giờ địa phương), tâm điểm của đợt ra mắt là MAI-Transcribe-2-Streaming, mô hình phiên âm thời gian thực đầu tiên của Microsoft. Mô hình này chuyển giọng nói thành văn bản ngay trong lúc người dùng đang nói, đồng thời liên tục cập nhật nội dung nhận diện trước khi chốt bản phiên âm cuối cùng khi phát ngôn kết thúc.
Cách vận hành này cho phép hệ thống phục vụ các tác vụ như hiển thị phụ đề trực tiếp hoặc bắt đầu xử lý yêu cầu ngay cả khi người dùng chưa nói xong.
Theo Microsoft, MAI-Transcribe-2-Streaming có thể trả kết quả phiên âm đầu tiên sau trung bình 320 mili giây. Mô hình hỗ trợ hơn 60 ngôn ngữ và có khả năng tự động nhận diện ngôn ngữ đang được sử dụng. Mức giá được công bố là 0,54 USD cho mỗi giờ âm thanh.
Bên cạnh đó, Microsoft cũng ra mắt hai mô hình tổng hợp giọng nói là MAI-Voice-2.1 và MAI-Voice-2.1-Flash. Trong đó, MAI-Voice-2.1 tập trung cải thiện độ biểu cảm và chất lượng âm thanh, còn MAI-Voice-2.1-Flash ưu tiên tốc độ phản hồi và tối ưu chi phí. Cả hai đều hỗ trợ 23 ngôn ngữ.
Trước đó, Microsoft đã công bố MAI-Transcribe-2, phiên bản không thời gian thực, vào tháng trước. Mức giá của mô hình này là 0,10 USD cho mỗi giờ âm thanh, thấp hơn 5 lần so với bản thời gian thực. Với phiên bản streaming, hệ thống phải liên tục trả về các kết quả tạm thời trong khi đầu vào âm thanh vẫn đang được ghi nhận, nên đòi hỏi tài nguyên xử lý cao hơn.
SiliconANGLE cho rằng đợt ra mắt lần này nằm trong chiến lược mở rộng các mô hình do Microsoft tự phát triển. Hồi tháng 7, Mustafa Suleyman, CEO Microsoft AI, từng nhấn mạnh việc tăng cường dòng MAI trong bối cảnh xuất hiện lo ngại về chi phí vận hành các mô hình hiệu năng cao từ OpenAI và Anthropic.
Microsoft được cho là hướng tới việc áp dụng các mô hình nội bộ cho những tác nhân Copilot trên các nền tảng như Excel và Outlook.