Nhóm nghiên cứu của Đại học Bắc Kinh ngày 23/8 công bố kết quả cho thấy các agent AI tự hành viết mã thường không tuân thủ quy định đóng góp tại các dự án mã nguồn mở. Ngay cả ở những kho mã cấm AI đóng góp, nhiều agent vẫn tiếp tục thực hiện tác vụ thay vì dừng lại.
Theo The New Stack, nhóm nghiên cứu đã thử nghiệm 4 mô hình AI tiên tiến trên 106 issue thuộc 49 kho mã nguồn mở, trong đó các quy định liên quan đến đóng góp bằng AI đã được nêu rõ. Sau đó, nhóm đối chiếu hành vi của từng mô hình với các quy định tương ứng.
Mức độ tuân thủ được đánh giá theo 4 tiêu chí: agent có từ chối thực hiện đóng góp hay không, có công khai việc sử dụng AI hỗ trợ hay không, có vượt qua bước kiểm chứng hay không, và có chuyển cho con người xử lý hay không. Kết quả cho thấy các agent hầu như không tự tìm và đọc quy định của dự án.
Khi nhóm nghiên cứu cung cấp quy định dưới dạng thông báo hoặc trích dẫn trực tiếp, đồng thời bổ sung phản hồi từ khâu kiểm chứng, hai tiêu chí về công khai và kiểm chứng đều được cải thiện. Tuy nhiên, ngay cả tại các kho mã cấm AI đóng góp, agent vẫn không dừng công việc.
Christian-Alexandru Staicu, nghiên cứu viên an ninh cấp cao tại Endor Labs, nhận định đây là một tình huống tiến thoái lưỡng nan về đạo đức đối với agent AI. Theo ông, các yêu cầu như công khai hay kiểm chứng khác với quy định cấm tuyệt đối, bởi lệnh cấm đồng nghĩa agent không được phép thực hiện đóng góp nào và điều này có thể xung đột với chỉ thị từ người dùng.
Mike McNeil, CEO của Fleet Device Management, nhắc lại một sự cố gần đây trên Hugging Face, khi một hệ thống AI tự hành vượt ra ngoài môi trường sandbox và xâm nhập vào hạ tầng vận hành. Ông cho rằng agent không phải lúc nào cũng làm đúng chỉ thị, mà thường chỉ tập trung vào việc hoàn thành nhiệm vụ được giao.
Timo Bozsolik-Torres, phụ trách AI tại SandboxAQ, cho biết GPT-5.5 là mô hình có hiệu năng tốt nhất trong thử nghiệm, nhưng cũng là mô hình có xu hướng từ chối đóng góp mạnh nhất. Ông nhấn mạnh vấn đề ở đây không nằm ở năng lực hiểu quy định.
Theo các chuyên gia, thay vì chỉ chỉnh sửa tài liệu chính sách, các dự án cần đặt thêm cơ chế kiểm soát bên ngoài agent.
Staicu cho rằng quy trình tra cứu chính sách nên được tích hợp vào công cụ thực thi, thay vì để mô hình tự quyết định. Bozsolik-Torres đề xuất không cấp công cụ đệ trình pull request cho các kho mã cấm AI đóng góp. Trong khi đó, McNeil nói rằng chỉ cần quy trình phê duyệt và hệ thống kiểm chứng tự động để ngăn người lạ hợp nhất mã, kho mã đã có thể được bảo vệ mà không cần thêm quy định riêng.