Google và OpenAI đang đồng loạt tăng tốc cuộc đua AI dành cho lập trình và AI agent, với trọng tâm không còn chỉ là năng lực mô hình mà chuyển sang tốc độ phản hồi trong các tác vụ thực tế.
Ngày 13/8 (giờ địa phương), Google ra mắt Gemini 3.7 Flash, mẫu AI chi phí thấp được tối ưu cho tác vụ lập trình và AI agent. Cùng ngày, OpenAI công bố GPT-5.6 Sol Ultrafast, phiên bản xử lý tốc độ cao dựa trên GPT-5.6 Sol.
Dù cùng nhắm tới nhu cầu xử lý nhanh, cách tiếp cận của hai công ty khá khác biệt. Gemini 3.7 Flash được triển khai ngay tại hơn 160 quốc gia, trong khi GPT-5.6 Sol Ultrafast hiện mới cung cấp giới hạn cho một số khách hàng dùng API.
Google định vị Gemini 3.7 Flash là mẫu chủ lực cho phát triển phần mềm, phát triển web và các tác vụ tri thức phức tạp. Mô hình này được nhắm tới vai trò nền tảng chi phí thấp cho AI agent có khả năng tự lập kế hoạch và thực hiện chuỗi tác vụ nhiều bước.
Gemini 3.7 Flash hỗ trợ tối đa 1 triệu token đầu vào và 64.000 token đầu ra. Ngoài văn bản, mô hình còn có thể xử lý hình ảnh, video, âm thanh và PDF, đồng thời hỗ trợ gọi công cụ và điều khiển máy tính.
Tốc độ là điểm nhấn chính trong lần ra mắt này. Theo Google, trong bài kiểm tra tác vụ lập trình, Gemini 3.7 Flash hoàn thành công việc trong 2 phút 13 giây, so với mức hơn 5 phút của phiên bản Flash liền trước.
Về giá, Google cho biết đến cuối năm nay, dịch vụ được tính 0,75 USD cho mỗi 1 triệu token đầu vào và 3,75 USD cho token đầu ra, tương đương khoảng một nửa mức giá khởi điểm của Gemini 3.6 Flash. Từ năm sau, giá sẽ tăng lên lần lượt 1,50 USD và 7,50 USD.
Google cũng cho biết trong các bài đánh giá nội bộ, Gemini 3.7 Flash vượt Claude Sonnet 5 và GPT-5.6 Terra ở 11 trên 18 hạng mục. Trên Code Arena, mô hình đạt 1.588 Elo, còn trên AutomationBench đạt 30,4%. Tuy nhiên, các số liệu này đều dựa trên phương pháp đánh giá nội bộ của Google.
Ở chiều ngược lại, OpenAI không giới thiệu một mô hình hoàn toàn mới mà bổ sung tùy chọn xử lý siêu nhanh cho GPT-5.6 Sol dưới tên gọi GPT-5.6 Sol Ultrafast.
Theo OpenAI, công ty sử dụng chip của Cerebras để tăng tốc độ phản hồi lên tối đa 14 lần so với mức tiêu chuẩn trước đó. Tốc độ xuất tối đa đạt 750 token mỗi giây.
Dịch vụ này phù hợp với các tình huống đòi hỏi phản hồi gần như tức thời trong khi hội thoại, chẳng hạn trợ lý giọng nói AI theo thời gian thực.
John Crepezie, kỹ sư AI tại Jane Street, nhận định tốc độ xử lý của Cerebras có thể làm thay đổi cách doanh nghiệp khai thác mô hình AI. Cortland Likins, Giám đốc sản phẩm tại Podium, cũng cho rằng tốc độ phản hồi nhanh trong các dịch vụ thoại có thể tạo ra khác biệt lớn về trải nghiệm cuộc gọi.
Tuy nhiên, xét về mức độ tiếp cận, OpenAI hiện chậm hơn Google. GPT-5.6 Sol Ultrafast mới được mở cho một số khách hàng trên OpenAI API và sẽ được mở rộng khi năng lực xử lý tăng lên.
Diễn biến này cho thấy khi AI agent ngày càng phổ biến, tốc độ phản hồi đang nổi lên như một chỉ số cạnh tranh mới. AI agent thường phải tiếp nhận yêu cầu, lập kế hoạch nhiều bước, gọi công cụ và tạo đầu ra. Vì vậy, không chỉ khả năng suy luận mà cả thời gian chờ ở từng bước cũng tác động trực tiếp đến trải nghiệm sử dụng.
Yếu tố này càng quan trọng hơn với AI giọng nói. Phản hồi càng chậm, cảm giác hội thoại tự nhiên càng suy giảm.
Google đang theo đuổi chiến lược giá thấp và triển khai rộng để thu hút nhà phát triển và doanh nghiệp. Trong khi đó, OpenAI chọn cách tận dụng hạ tầng tính toán của Cerebras để đẩy tốc độ xử lý của một mô hình cao cấp lên mức tối đa.
Điều đó cho thấy cuộc đua AI không còn dừng ở câu hỏi mô hình nào “thông minh” hơn, mà đang mở rộng sang việc mô hình nào xử lý công việc thực tế nhanh hơn và với chi phí thấp hơn.
Trong bối cảnh đó, các bước đi tiếp theo của hai công ty đang được theo dõi sát. Google chưa công bố thời điểm ra mắt Gemini 3.5 Pro, mẫu hiệu năng cao chủ lực của hãng. Về phía OpenAI, việc chọn tăng tốc bằng hạ tầng của Cerebras thay vì hệ thống tự xây dựng cũng cho thấy tốc độ dịch vụ và cách triển khai đang trở thành trọng tâm cạnh tranh mới, bên cạnh năng lực mô hình.