Nota ngày 6/8 cho biết đã tối ưu mô hình AI Kimi K3 của Moonshot AI, giúp giảm tới một nửa số GPU cần để vận hành mà vẫn duy trì hiệu năng trên nhiều bài benchmark.
Kimi K3 là mô hình AI open-weight sử dụng kiến trúc mixture of experts (MoE), với quy mô 2.800 tỷ tham số. Mô hình này chỉ kích hoạt các expert cần thiết tùy theo đầu vào để nâng hiệu quả tính toán, song vẫn cần tới 8 GPU Nvidia B300 để vận hành.
Theo Nota, ngay từ giai đoạn huấn luyện, Kimi K3 đã được lượng tử hóa với trọng số 4 bit và giá trị kích hoạt 8 bit. Vì vậy, dư địa nén thêm bằng các phương pháp lượng tử hóa phổ biến là khá hạn chế.
Để tinh gọn mô hình, công ty đã áp dụng công nghệ “Non-uniform Expert Pruning” do chính Nota phát triển. Kỹ thuật này phân tích đặc tính ở từng tầng cũng như mức độ quan trọng của từng expert, từ đó giữ lại các expert cốt lõi và loại bỏ có chọn lọc những mô-đun đóng góp thấp.
Nota đã công bố hai phiên bản tinh gọn của mô hình, tương ứng với mức cắt giảm 25% và 50% số mô-đun expert. Nhờ đó, số GPU Nvidia B300 cần cho vận hành giảm từ 8 xuống còn lần lượt 6 và 4 GPU.
Theo kết quả đánh giá nội bộ, so với REAP (Router-weighted Expert Activation Pruning) - phương pháp loại bỏ expert theo cùng một tỷ lệ ở mọi tầng - phiên bản được cắt giảm 50% của Nota cho khả năng giữ hiệu năng tốt hơn trên nhiều bài benchmark.
Ông Kim Tae-ho, Giám đốc Công nghệ (CTO) của Nota, cho biết công ty sẽ tiếp tục mở rộng phạm vi ứng dụng công nghệ này, nhằm hỗ trợ triển khai hiệu quả các mô hình AI frontier ngay cả trong điều kiện tài nguyên tính toán hạn chế.