Google ngày 26/8 (giờ địa phương) công bố bộ mô hình AI giọng nói Gemini 3.5, gồm Gemini 3.5 Live, Gemini 3.5 Live Experimental và Gemini 3.5 Transcribe. Động thái này cho thấy hãng đang đẩy mạnh nâng cấp chất lượng hội thoại bằng giọng nói, đồng thời tăng tốc độ chuyển giọng nói thành văn bản.
Trong đợt cập nhật lần này, Google mở rộng danh mục mô hình AI giọng nói với Gemini 3.5 Live dành cho trợ lý hội thoại Gemini Live, bản Gemini 3.5 Live Experimental dành cho nhà phát triển và Gemini 3.5 Transcribe cho tác vụ chuyển giọng nói thành văn bản.
Theo TechRadar và nhiều nguồn tin quốc tế, Gemini 3.5 Live cải thiện rõ khả năng xử lý khi người dùng ngắt lời so với Gemini 3.1 Live. Mô hình cũng hỗ trợ xử lý thông tin hình ảnh theo thời gian thực, nhận diện tình huống trộn nhiều ngôn ngữ và gọi các công cụ chạy nền. Trước đây, Gemini Live chưa thể truy cập và sử dụng công cụ, nhưng bản cập nhật mới đã mở rộng đáng kể phạm vi ứng dụng.
Các phiên bản Gemini Live trước đó thường gặp lỗi ở khâu nhận dạng giọng nói và duy trì mạch hội thoại. Trong một số trường hợp, hệ thống nhận sai ngôn ngữ, tự chuyển sang ngôn ngữ khác hoặc khi bị ngắt lời thì phát sinh nhiễu rồi quay về giọng mặc định thay vì giọng người dùng đã chọn. Google kỳ vọng Gemini 3.5 Live sẽ khắc phục các vấn đề này.
Gemini 3.5 Transcribe là mô hình mới thay thế Chirp 3 trong mảng chuyển giọng nói thành văn bản. Google cho biết thời gian từ lúc nhận giọng nói đến khi xuất ra văn bản cuối cùng đã giảm khoảng 70% so với Chirp 3, trong khi tỷ lệ lỗi nhận dạng theo thời gian thực giảm xuống còn 5,5%, so với mức 7,32% trước đó.
Ngoài độ chính xác, Gemini 3.5 Transcribe còn được bổ sung nhiều tính năng xử lý ngữ cảnh. Mô hình có thể tự lọc các từ đệm như “ừm”, “ờ” trong khi nói, đồng thời cập nhật theo thời gian thực khi người dùng tự đính chính để viết lại câu. Hệ thống cũng tham chiếu kho từ vựng tùy biến mà người dùng đã đăng ký để xử lý các thuật ngữ chuyên ngành. Các tính năng này hỗ trợ 85 ngôn ngữ và, với bản ghi âm có sẵn, có thể phân biệt tối đa ba người nói.
Tuy nhiên, việc AI tự suy đoán ý định người dùng để làm mượt câu chữ cũng là một hạn chế. Văn bản đầu ra có thể khác với phát ngôn thực tế. Với các câu ngắn, hệ thống có thể tự chỉnh cách diễn đạt hoặc sửa nói lắp, nhưng cơ chế này không phù hợp với mọi tình huống vì có thể làm thay đổi cách diễn đạt ban đầu.
Google cho biết Gemini 3.5 Transcribe đã được đưa vào một số sản phẩm. Tiêu biểu là tính năng Rambler trên bàn phím Gboard dành cho Android, cho phép chuyển lời nói dài dòng thành văn bản gọn hơn và tự loại bỏ từ đệm. Hiện tính năng này mới hỗ trợ trên Pixel 11. Google cho biết sẽ mở rộng sang “nhiều thiết bị tích hợp Gemini Intelligence” trong năm nay.
Trên ứng dụng Gemini cho macOS, từ ngày 26/8, mô hình này cũng được áp dụng cho nhập liệu bằng giọng nói. Khi kết hợp với nhận diện màn hình, hệ thống có thể tóm tắt tệp nội bộ, chuyển văn bản giữa các ứng dụng và tạo ảnh tại vị trí con trỏ chỉ bằng lệnh thoại.
Mảng hỗ trợ nhà phát triển cũng được mở rộng. Từ ngày 26/8, công cụ lập trình Antigravity hỗ trợ Gemini 3.5 Transcribe, cho phép tham chiếu cả ngữ cảnh màn hình lẫn lịch sử hội thoại nếu người dùng đồng ý. Mô hình này cũng được đưa vào các bản dựng trong AI Studio, cho phép phát triển ứng dụng chỉ bằng giọng nói theo kiểu “vibe coding”. Nhà phát triển cũng có thể truy cập mô hình thông qua Gemini API.
Google cho biết sẽ sớm đưa tính năng này lên trình duyệt Chrome. Khi được triển khai, người dùng có thể nhập liệu bằng giọng nói ở mọi ô văn bản trên web, từ trả lời email, soạn bài đăng mạng xã hội đến nhập prompt cho chatbot AI.
Ba mô hình Gemini 3.5 Live, Gemini 3.5 Live Experimental và Gemini 3.5 Transcribe được công bố cùng ngày. Trong đó, Gemini 3.5 Live Experimental nổi bật với khả năng giải thích theo thời gian thực từng bước trong các tác vụ suy luận phức tạp.
Trước mắt, ba mô hình này được cung cấp bằng tiếng Anh cho toàn bộ người dùng ứng dụng Gemini trên macOS và người dùng Rambler trên Android tại một số quốc gia, khu vực ngôn ngữ. Với nhà phát triển, các mô hình được cung cấp dưới dạng public preview qua AI Studio và Gemini API. Google chưa công bố thời điểm mở rộng cho toàn bộ người dùng, nhưng việc triển khai được dự báo sẽ diễn ra trong vài ngày tới.
Đợt ra mắt này diễn ra trong bối cảnh Gemini 3.5 Pro, mẫu mà Google từng dự báo sẽ ra mắt vào tháng 6, đến nay vẫn chưa được phát hành.