OpenAI đã phát hành GPT-Live-1 API dành cho nhà phát triển, mở rộng công nghệ AI giọng nói thời gian thực ra ngoài ChatGPT. Mô hình mới cho phép xây dựng tác nhân giọng nói có thể vừa nghe vừa nói, chen lời trong lúc hội thoại và phản hồi tự nhiên hơn so với các hệ thống truyền thống.
Theo Gigazine, ngày 11/9, OpenAI bắt đầu cung cấp GPT-Live-1 API từ ngày 10/9 theo giờ địa phương. Với API này, nhà phát triển có thể tùy chỉnh giọng điệu, tốc độ nói, cách đối thoại và luồng phản hồi của tác nhân AI giọng nói.
Điểm cốt lõi của GPT-Live-1 nằm ở cơ chế song công toàn phần. Thay vì xử lý theo chuỗi chuyển giọng nói thành văn bản, đưa qua mô hình ngôn ngữ rồi tổng hợp lại thành âm thanh, GPT-Live-1 xử lý đồng thời đầu vào và đầu ra âm thanh trong cùng một mô hình. Nhờ đó, cuộc trò chuyện vẫn có thể tiếp diễn ngay cả khi người dùng ngắt lời hoặc bổ sung ý trong lúc AI đang phản hồi.
OpenAI cho biết cách tiếp cận này giúp giảm độ trễ, đồng thời hạn chế độ bất ổn phát sinh khi thông tin phải đi qua nhiều mô hình khác nhau. Hệ thống cũng được thiết kế để xử lý tự nhiên hơn với tiếng ồn môi trường và các khoảng im lặng, đồng thời cải thiện khả năng duy trì ngữ cảnh trong các cuộc hội thoại dài.
Một điểm đáng chú ý khác với nhà phát triển là khả năng tùy chỉnh phong cách trò chuyện của tác nhân giọng nói. Thông qua system prompt, nhà phát triển có thể thiết lập tốc độ nói, ngữ điệu và phong cách đối thoại, đồng thời lựa chọn các giọng nói hỗ trợ nhiều ngôn ngữ và phương ngữ.
Với các tác vụ phức tạp, OpenAI cho phép tách phần hội thoại giọng nói và phần suy luận. Theo đó, GPT-Live-1 đảm nhận tương tác bằng giọng nói, còn các tác vụ suy luận hoặc gọi công cụ sẽ do mô hình văn bản như GPT-6 Astra hoặc một mô hình bên ngoài xử lý. Cách triển khai này phù hợp với các tác nhân AI dạng tổng đài, chẳng hạn dịch vụ đặt chỗ nhà hàng hoặc chăm sóc khách hàng qua điện thoại.
OpenAI cũng cho biết hiệu năng của GPT-Live-1 đã được cải thiện so với thế hệ trước. Theo công ty, mô hình này có điểm benchmark song công cao hơn 30% so với GPT-Realtime-2.1, đồng thời cải thiện độ trễ khi chuyển lượt hội thoại và chất lượng tương tác. Khi kết hợp với GPT-6 Astra, GPT-Live-1 đứng đầu theo thang đánh giá năng lực tác vụ Tau3 dành cho tác nhân giọng nói.
Một số doanh nghiệp đã bắt đầu đưa mô hình vào vận hành. Trong đó, EliseAI - đơn vị cung cấp giải pháp AI cho lĩnh vực nhà ở và cơ sở y tế - tham gia với vai trò đối tác thiết kế ban đầu và đã triển khai GPT-Live-1 trong môi trường thực tế.
Về giá, OpenAI niêm yết mức 0,05 USD mỗi phút cho lớp giọng nói ở phía trước. Nhà phát triển có thể kết hợp thêm mô hình suy luận phía sau cùng các tính năng tác nhân cần thiết để xây dựng dịch vụ AI giọng nói phù hợp với từng nhu cầu.
Động thái này cho thấy OpenAI đang đẩy mạnh thương mại hóa AI giọng nói thời gian thực cho các kịch bản ngoài ChatGPT, như tổng đài, đặt chỗ và tư vấn qua điện thoại. Thị trường hiện cũng theo dõi liệu mô hình hội thoại có thể vừa nghe vừa nói và chen lời tự nhiên có trở thành giao diện mới cho các dịch vụ thực tế hay không.
Trên mạng xã hội X, OpenAI cho biết GPT-Live-1 hiện đã có mặt trong API, cho phép đưa khả năng đối thoại tự nhiên của ChatGPT vào ứng dụng, đồng thời kết hợp với các mô hình và bộ công cụ do nhà phát triển tự lựa chọn.