Một nghiên cứu mới cho thấy mô hình trí tuệ nhân tạo (AI) có giá thấp không đồng nghĩa với tổng chi phí triển khai thấp hơn. Trong hơn 6.800 tác vụ được thử nghiệm, có tới 32% trường hợp mô hình rẻ hơn lại phát sinh chi phí cao hơn mô hình đắt hơn.
Theo Gigazine ngày 6/10 (giờ địa phương), nhóm nghiên cứu từ Đại học Stanford, Đại học Carnegie Mellon, Đại học California Berkeley và Microsoft Research đã thử nghiệm 8 mô hình AI tiên tiến trên hơn 6.800 tác vụ. Kết quả cho thấy chênh lệch về giá niêm yết không phản ánh đầy đủ chi phí thực tế khi vận hành.
Nghiên cứu tập trung so sánh cấu trúc chi phí thực tế giữa các mô hình giá rẻ và giá cao ở nhiều nhóm tác vụ như toán học, lập trình và khoa học. Theo nhóm nghiên cứu, chỉ nhìn vào chi phí trên mỗi token hoặc chi phí cho mỗi lần gọi mô hình là chưa đủ, bởi số bước suy luận và thực thi để hoàn thành cùng một nhiệm vụ có thể chênh lệch rất lớn.
Một ví dụ được đưa ra là tác vụ phân tích video YouTube theo từng khung hình. Mô hình Gemini 3.1 Pro hoàn thành tác vụ sau 85 bước, trong khi Gemini 3 Flash vẫn chưa xử lý xong dù đã vượt quá 1.000 bước. Tổng chi phí cho tác vụ này là 1 USD với Gemini 3.1 Pro, nhưng lên tới 14 USD với Gemini 3 Flash.
Nhóm nghiên cứu cho rằng hiện tượng chi phí bị đảo ngược này xuất phát từ việc AI suy luận quá mức và thực thi quá mức. Với các tác vụ phức tạp, số bước xử lý có thể tăng mạnh, khiến mô hình có hiệu năng cao hoàn thành nhanh hơn và thậm chí rẻ hơn. Ở một phép thử quy mô lớn, Gemini 3 Flash tiêu tốn hơn 60.000 token suy nghĩ, trong khi GPT-5.4 xử lý cùng tác vụ chỉ với 25 token.
Nghiên cứu cũng cho thấy chi phí vận hành AI rất khó dự báo. Khi lặp lại cùng một chỉ thị trên cùng một mô hình, có trường hợp lần chạy đắt nhất cao gấp 9,7 lần lần rẻ nhất. Điều này đồng nghĩa biến động chi phí không chỉ đến từ việc chọn mô hình, mà còn xuất hiện ngay cả khi chạy lặp lại trên cùng một hệ thống.
Từ kết quả trên, nhóm nghiên cứu nhận định chiến lược triển khai AI của doanh nghiệp không nên dừng ở việc so sánh giá niêm yết. Các tác vụ đơn giản có thể phù hợp với mô hình giá rẻ, nhưng với công việc phức tạp, tổng chi phí thực tế có thể tăng mạnh. Lin Zhao Chen, một thành viên tham gia thí nghiệm, cho biết không nên chỉ dựa vào giá để kết luận mô hình nào rẻ hơn.
Nghiên cứu này một lần nữa cho thấy bảng giá dịch vụ AI không phản ánh trực tiếp chi phí vận hành thực tế. Với những tác vụ đòi hỏi nhiều bước suy luận và sử dụng công cụ, chênh lệch hiệu năng giữa các mô hình có thể là yếu tố quyết định tổng chi phí. Vì vậy, doanh nghiệp triển khai AI trả phí được khuyến nghị theo dõi thêm tỷ lệ hoàn thành tác vụ, số bước xử lý và mức độ biến động chi phí qua các lần chạy, thay vì chỉ nhìn vào đơn giá đầu vào.