KAIST cho biết đã phát triển RL-SPH, một công nghệ học tăng cường cho phép AI tự tìm ra các phương án có thể triển khai trong thực tế cho những bài toán tối ưu hóa như logistics, sản xuất hay phân ca, mà không cần phụ thuộc vào bộ giải tối ưu hóa chuyên dụng từ bên ngoài.
Ngày 3/8/2026, Viện Khoa học và Công nghệ Tiên tiến Hàn Quốc (KAIST) cho biết nhóm nghiên cứu do giáo sư Kim Min-su thuộc Khoa Khoa học Máy tính dẫn dắt đã phát triển RL-SPH nhằm huấn luyện AI lập kế hoạch đáp ứng các ràng buộc thực tế.
Theo KAIST, các bài toán như giao nhận logistics, định tuyến phương tiện, lập lịch sản xuất trong nhà máy hay xếp ca tại bệnh viện đều thuộc nhóm quy hoạch tuyến tính nguyên có ràng buộc (ILP). Đây là các bài toán đòi hỏi không chỉ hiệu quả về chi phí và thời gian mà còn phải đồng thời thỏa mãn nhiều điều kiện vận hành. Chẳng hạn, trong giao hàng, nếu vượt tải trọng xe hoặc vi phạm thời gian làm việc của tài xế, phương án đó sẽ không thể triển khai ngoài thực tế.
KAIST cho biết các kỹ thuật AI hiện nay có thể đề xuất phương án giúp giảm chi phí hoặc rút ngắn thời gian, nhưng vẫn có trường hợp vi phạm những ràng buộc thực tế như tải trọng hay giờ làm. Khi đó, hệ thống vẫn phải dựa vào các chương trình tối ưu hóa chuyên dụng để hiệu chỉnh lời giải do AI tạo ra.
Khác với cách tạo lời giải ngay từ đầu, RL-SPH hoạt động theo hướng tinh chỉnh dần phương án hiện có qua từng bước. Mục tiêu ưu tiên không phải tìm lời giải tối ưu ngay lập tức, mà là tìm được một phương án khả thi trước.
Nhóm nghiên cứu áp dụng chiến lược tìm kiếm hai giai đoạn. Ở giai đoạn đầu, hệ thống tập trung tìm một nghiệm khả thi thỏa mãn toàn bộ ràng buộc. Sau đó, khi đã giữ được các điều kiện này, AI tiếp tục tối ưu để giảm chi phí và thời gian. Nghiên cứu cũng sử dụng mô hình ILP-GT để học mối quan hệ giữa các biến và ràng buộc, đồng thời áp dụng chiến lược ưu tiên điều chỉnh những biến có ảnh hưởng lớn đến khả năng tìm nghiệm.
Khi đánh giá RL-SPH trên 5 bộ benchmark, nhóm nghiên cứu cho biết công nghệ này đều tìm được phương án khả thi ở tất cả bài toán. Ngay cả với các bài toán phức tạp có biến nguyên tổng quát, tỷ lệ tìm được nghiệm khả thi vẫn đạt 100%.
So với các kỹ thuật hiện có, chỉ số “primal gap” - phản ánh mức chênh lệch so với nghiệm tối ưu - được cải thiện trung bình 28,6 lần. Chỉ số “primal integral”, dùng để đánh giá chất lượng và tốc độ của quá trình tìm kiếm, cải thiện 2,6 lần. Thời gian để tìm ra phương án khả thi đầu tiên cũng nhanh hơn trung bình 2,5 lần.
Trong phép so sánh với các kỹ thuật AI mới như PAS, DDIM và DiffILO, RL-SPH là phương pháp duy nhất đạt tỷ lệ tìm nghiệm khả thi 100% trên toàn bộ benchmark. Thời gian huấn luyện trung bình là 30 phút, nhanh hơn 14,7 lần so với các kỹ thuật hiện có và nhanh hơn khoảng 34 lần so với các phương pháp dựa trên học không giám sát.
Ở bài đánh giá MIPLIB, benchmark tối ưu hóa quốc tế, RL-SPH cũng tìm được nghiệm khả thi cho các bài toán có quy mô lớn hơn tới 67 lần so với trước đây, đồng thời xử lý được cả những dạng bài toán mới mà mô hình chưa từng gặp trong quá trình huấn luyện.
Giáo sư Kim Min-su cho rằng trong thực tế, một phương án có thể triển khai thường quan trọng hơn một phương án “tốt nhất” về mặt lý thuyết. Ông kỳ vọng công nghệ này sẽ trở thành nền tảng để mở rộng việc ra quyết định dựa trên AI trong nhiều lĩnh vực như logistics, sản xuất, bán dẫn và vận hành nhân sự.
Nghiên cứu có sự tham gia của nghiên cứu sinh tiến sĩ Lee Tae-hoon thuộc Khoa Khoa học Máy tính với vai trò tác giả thứ nhất, trong khi giáo sư Kim Min-su là tác giả liên hệ. Kết quả nghiên cứu đã được công bố tại Hội nghị Quốc tế về Học máy (ICML) diễn ra vào tháng 7.