Theo Techzine, ngày 6/9 (giờ địa phương), Spotify cho biết đã phát triển một cách tiếp cận giúp cắt giảm mạnh lượng token khi sử dụng Claude Code.
Cốt lõi của phương án này là chuyển các tác vụ lặp lại như đọc tệp hoặc tạo những đoạn mã dễ dự đoán sang các mô hình AI chi phí thấp hơn thông qua cổng dành cho nhà phát triển do công ty tự xây dựng. Kết quả thử nghiệm cho thấy lượng token mà Claude Code tiêu thụ giảm trung bình 90%.
Theo bài viết, hệ thống do Spotify phát triển vận hành quanh các agent mang tên “AiKA mode”. Các agent này chạy trong môi trường runtime tạm thời. Lập trình viên chỉ cần chọn mô hình, chỉ dẫn và công cụ MCP tương ứng với từng mode, thay vì phải tự quản lý hạ tầng hay API key.
Kỹ sư Spotify Dimitri Mazmanov đã thử nghiệm cách làm này trên một monorepo Java. Ông thiết lập hai mode gồm “bulk reader” để đọc nhiều tệp và “code writer” để tạo các đoạn mã mang tính lặp lại, dễ dự đoán. Cả hai đều sử dụng Google Gemini 2.5 Flash làm mô hình worker đảm nhận phần thực thi tác vụ, đồng thời có thể chuyển sang mô hình khác ngay trên cổng.
Mazmanov cho biết các agent này phần lớn không đòi hỏi năng lực suy luận, mà chủ yếu xử lý các tác vụ nhập/xuất (I/O). Theo ông, ngay cả khi giao cho AI thực hiện, những tác vụ này vẫn phát sinh chi phí đáng kể. Vì vậy, Spotify tách phần I/O khỏi Claude, vốn có chi phí cao hơn, để các mô hình frontier chỉ tập trung vào những phần việc thực sự cần suy luận.
Spotify cũng nhấn mạnh các mô hình worker không phù hợp cho những công việc như gỡ lỗi, ra quyết định về kiến trúc hay các tác vụ suy luận cốt lõi. Ngoài ra, phần việc được giao cho các mô hình phụ không phải lúc nào cũng cung cấp chính xác thông tin chi tiết theo từng dòng mà Claude cần để chỉnh sửa mã.
Các tác vụ được ủy thác này thường mất từ 10 đến 30 giây, trong khi cổng của Spotify giới hạn 30 giây cho mỗi lần gọi. Hai mode “bulk reader” và “code writer” hiện đã được công bố thông qua AiKA, cho phép lập trình viên tái sử dụng hoặc điều chỉnh theo nhu cầu từng dự án.