Microsoft đã công bố Agent Lightning v1.0 trên GitHub, một framework học tăng cường cho agent. Theo công ty, cách tiếp cận này đặt production harness vào trung tâm vòng lặp huấn luyện và đã giúp điểm SWE-bench Verified của mô hình Qwen3.5-9B tăng từ 41,8% lên 56,4%.
Theo The New Stack, điểm khác biệt lớn nhất của Agent Lightning v1.0 nằm ở production harness, thay vì bản thân mô-đun huấn luyện. Thành phần này phụ trách cấu hình ngữ cảnh, gọi công cụ và điều phối vòng lặp tương tác giữa agent với môi trường.
Trong mô hình này, phần huấn luyện chỉ quan sát log tương tác giữa LLM và harness. Nhờ đó, lập trình viên không phải tự xây thêm logic riêng trong hệ thống huấn luyện để agent sử dụng công cụ và tương tác với môi trường.
Microsoft cho biết đã huấn luyện tăng cường cho Qwen3.5-9B với nguồn lực tính toán ở mức vừa phải và chỉ 6.000 mẫu dữ liệu. Kết quả, điểm benchmark SWE-bench Verified tăng 14,6 điểm phần trăm, từ 41,8% lên 56,4%.
Theo cách làm truyền thống, pipeline huấn luyện phải xử lý trọn vẹn vòng lặp tương tác, kéo theo nhiều vấn đề như retokenization, gộp mẫu, tính toán advantage, chuẩn hóa hàm loss và lập lịch backend huấn luyện. Để khắc phục, Microsoft cung cấp kèm pipeline tinh lọc dữ liệu cho agent lập trình, cùng các script huấn luyện có thể tái lập kết quả. Toàn bộ framework gồm khoảng 3.500 dòng mã Python cốt lõi và được phát hành theo giấy phép MIT.
Rashid Hasan, nghiên cứu viên về kỹ thuật phần mềm tại Nebraska, nhận định việc huấn luyện trực tiếp thông qua production harness có thể giúp thu hẹp độ lệch giữa giai đoạn huấn luyện và triển khai thực tế. Theo ông, các giao thức gọi công cụ, chính sách ngữ cảnh và cơ chế phục hồi được giữ nguyên, nhờ đó kết quả huấn luyện có thể chuyển sang môi trường production hiệu quả hơn.
Priyank Jain, nhà khoa học dữ liệu tại Colorado, đánh giá đây là nỗ lực nhằm xử lý “độ lệch giữa huấn luyện và triển khai” - một trong những bài toán lâu đời và tốn kém nhất của machine learning. Theo ông, giá trị lớn nhất của cách tiếp cận này là mô hình được huấn luyện trên đúng hệ thống sẽ được đưa vào triển khai. Dù vậy, ông cũng lưu ý số người thử áp dụng học tăng cường mà chưa hiểu rõ thiết kế phần thưởng có thể sẽ tăng lên.
Ria Banerjee, nhà sáng lập ToolDex, cho rằng quy mô mã nguồn gọn nhẹ là một điểm cộng vì giúp các kỹ sư hạ tầng có thể trực tiếp đọc và đánh giá mức độ tin cậy của hệ thống. Tuy nhiên, bà lưu ý trên thực tế chỉ những nhóm nền tảng sở hữu cụm GPU và Kubernetes mới có thể tận dụng đầy đủ framework này. Bà cũng nhấn mạnh rằng mỗi thay đổi đối với harness đều sẽ được phản ánh trực tiếp vào trọng số mô hình, vì vậy bản thân harness cũng cần được quản lý phiên bản.