Nhiều chuyên gia cho rằng để giảm chi phí AI, doanh nghiệp không thể chỉ dừng ở việc chọn mô hình rẻ hơn, mà cần cắt giảm token không cần thiết và lượng tính toán dư thừa ngay từ khâu thiết kế hệ thống.
Theo TechRadar ngày 1/10 (giờ địa phương), Ben Canning, Giám đốc Sản phẩm (CPO) của Alteryx, nhận định chi phí mô hình đang trở thành gánh nặng mới khi AI được triển khai từ giai đoạn thử nghiệm sang vận hành ở quy mô lớn. Ông cho rằng các giải pháp như định tuyến mô hình (model routing) hay sử dụng mô hình open-weight có thể giúp tiết kiệm chi phí, nhưng khó xử lý tận gốc bài toán này.
Sự xuất hiện của các mô hình có chi phí thấp nhưng hiệu năng cao, như Kimi K3 của Moonshot AI (Trung Quốc), đang thúc đẩy doanh nghiệp phân bổ mô hình theo từng nghiệp vụ. Tuy nhiên, Canning cho rằng trước khi chọn mô hình, doanh nghiệp cần xác định rõ liệu một tác vụ có thực sự cần đến mô hình ngôn ngữ lớn (LLM) hay không.
Với các công việc lặp lại như đối chiếu tệp, áp dụng quy định nội bộ hay kiểm tra tuân thủ, việc gọi LLM cho từng lần xử lý có thể làm mô hình phải liên tục diễn giải lại cùng một ngữ cảnh và bộ quy tắc. Điều này làm tăng mức tiêu thụ token và tài nguyên tính toán. Rủi ro cũng lớn hơn khi mô hình phải nhiều lần xử lý lại những thông tin đặc thù của doanh nghiệp, chẳng hạn cách tính doanh thu, biên lợi nhuận hay các quy định nội bộ.
Giải pháp được Canning đề xuất là xây dựng các lớp logic nghiệp vụ. Theo đó, doanh nghiệp thiết kế sẵn workflow cho những tác vụ lặp lại, đồng thời mã hóa các quy tắc và định nghĩa riêng của từng công ty vào hệ thống. Khi đó, LLM không trực tiếp thực hiện tính toán mà chủ yếu truy xuất kết quả và diễn giải lại cho người dùng.
Ví dụ, khi người dùng hỏi về biên lợi nhuận của một nhóm, hệ thống có thể hoàn tất phép tính trên nền tảng dữ liệu đám mây trước, sau đó LLM chỉ đảm nhận phần trình bày kết quả. Cách tiếp cận này giúp giảm nhu cầu xử lý ngữ cảnh lớn và hạn chế các tác vụ suy luận lặp lại.
Theo Canning, cấu trúc trên đặc biệt quan trọng với những lĩnh vực đòi hỏi câu trả lời nhất quán theo các quy tắc cố định như thuế, tài chính và tuân thủ. Ông nhấn mạnh trọng tâm của tối ưu chi phí AI không nằm ở việc chỉ tìm mô hình rẻ hơn, mà ở chỗ xây dựng workflow và logic nghiệp vụ đủ tin cậy để tránh tạo ra token không cần thiết ngay từ đầu.