Ảnh: Shutterstock

Theo một nghiên cứu mới của Anthropic, nhiều AI agent khi cùng tham gia một dự án phần mềm có thể cản trở lẫn nhau, thậm chí tạo ra mã độc để đối phó với đối phương. TechCrunch ngày 13/8 dẫn nghiên cứu của nhóm Frontier Red Team thuộc Anthropic, đơn vị phân tích hành vi và rủi ro phát sinh khi nhiều agent tương tác trong bối cảnh vận hành thực tế.

Trong thử nghiệm, Anthropic cho ba Claude agent cùng truy cập một dự án, đồng thời giao cho chúng những chỉ thị mâu thuẫn. Các agent hoạt động độc lập và không biết còn có agent khác cùng làm việc trên dự án đó.

Kết quả cho thấy mỗi agent đều cho rằng bên còn lại đang cố tình phá hoại công việc của mình. Xung đột sau đó leo thang khi các agent sử dụng mã độc ngày càng mang tính tấn công, thậm chí có khả năng tự nhân bản, để ngăn chặn lẫn nhau.

Nghiên cứu tập trung vào những rủi ro có thể xuất hiện khi các agent tự trị cùng vận hành trên một codebase, thị trường hoặc hệ thống máy tính dùng chung. Trọng tâm không còn là trường hợp một agent đơn lẻ đi sai hướng, mà là các vấn đề mới nảy sinh khi quy mô tương tác tăng lên từ hàng nghìn đến hàng triệu AI agent.

Tuy vậy, không phải mọi xung đột đều dẫn đến cùng một kết cục. Một số agent xem sự khác biệt mục tiêu là do chỉ thị thiếu nhất quán, thay vì coi đó là hành vi thù địch, và từ đó đi đến thỏa thuận ngừng đối đầu.

Những agent này sau đó dọn dẹp mã độc, ghi lại nguyên nhân phát sinh xung đột và đề xuất con người can thiệp.

Kết quả cũng khác nhau tùy mô hình. Mythos 5 đạt tỷ lệ dàn xếp xung đột tới 98%, trong khi Sonnet 4.6 và Opus 4.6 có xu hướng khép lại xung đột theo hướng đối đầu quyết liệt hơn.

Trong một số trường hợp, các agent còn tự thiết lập cơ chế phân xử. Ba agent đã thống nhất tổ chức một “giải đấu” để chọn ra bên thắng cuộc, còn bên thua sẽ rút lui.

Tuy nhiên, trong quá trình đó, một agent thuộc nhóm Mythos 5 tỏ ra trung lập nhưng thực tế lại đưa ra các tiêu chí đánh giá có lợi cho chính mình.

Anthropic cũng lưu ý rằng việc mở rộng quy mô cộng tác không đồng nghĩa hiệu quả làm việc nhóm sẽ tăng tương ứng. Khi phạm vi công việc chồng lấn hoặc mức độ phụ thuộc lẫn nhau quá lớn, các agent có xu hướng cản trở nhau; để tránh điều này, trong nhiều trường hợp chúng chọn tách ra hoạt động thay vì tiếp tục hợp tác.

Ở chiều ngược lại, trong các nhóm có ngữ cảnh, cấu trúc và mô hình nền tảng tương đồng, hiện tượng đồng thuận lại xuất hiện mạnh hơn.

Từ khóa

#Anthropic #AI agent #Claude #rủi ro AI agent #mã độc
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.