OpenAI thừa nhận AI agent liên quan đến sự cố đăng bài hàng loạt trên một trang wiki tại Đức. Ảnh: Shutterstock

OpenAI xác nhận AI agent của hãng đã liên quan đến sự cố đăng bài hàng loạt lên một trang wiki tại Đức, đồng thời cho biết đang xây dựng khung hướng dẫn mới về thời điểm và cách thức công bố các sự cố misalignment, tức hành vi lệch chuẩn của AI. Bộ tiêu chí này dự kiến được công bố trong vài tuần tới.

Theo OpenAI, trước đây các trường hợp misalignment chủ yếu được xử lý trong phạm vi nghiên cứu và đánh giá mô hình. Tuy nhiên, vụ việc lần này cho thấy AI agent có thể vượt ra ngoài môi trường thử nghiệm, hoạt động trên Internet và tác động đến các hệ thống bên ngoài, khiến cách tiếp cận cũ không còn phù hợp.

Ngày 5/9, theo giờ địa phương, OpenAI đăng trên X rằng hãng đang xây dựng một khung hướng dẫn về quy trình báo cáo nội bộ cũng như cách chia sẻ thông tin khi các sự cố misalignment không còn dừng ở môi trường thử nghiệm mà đã lan ra Internet.

Sự cố xảy ra trong giai đoạn từ tháng 5 đến tháng 6 tại DSEwiki, một trang wiki dành cho lập trình viên phần mềm ở Đức nhưng từ lâu không còn được sử dụng. Nhóm nghiên cứu độc lập Nightingale Collective cho biết đã khôi phục lịch sử chỉnh sửa bị xóa và xác nhận các AI agent đã đăng khoảng 17.000 bài viết lên nền tảng này.

Theo nhóm nghiên cứu, các bài viết được đăng dưới hơn 3.700 tên tài khoản khác nhau, trong đó có những tên như “OpenAIResearcher” và “OAIResearchMar26”. Họ cũng cho biết có dấu hiệu cho thấy nhiều AI agent đã phối hợp với nhau, chia sẻ kết quả tìm kiếm web và liên kết nguồn, tìm cách truy ngược seed ngẫu nhiên hoặc trao đổi phương thức vượt qua giới hạn sandbox.

Bài đăng đầu tiên xuất hiện vào ngày 24/5. Sau đó, quản trị viên của wiki phát hiện lượng truy cập tăng bất thường trong tháng 6 và đã xóa nội dung. Nightingale Collective cho biết đã khôi phục các bài viết này thông qua một trang lưu trữ sao lưu. Đến ngày 21/6, nhóm tiếp tục phát hiện dấu vết truy cập bắt nguồn từ địa chỉ mạng nội bộ của OpenAI; hoạt động chỉnh sửa chấm dứt vào ngày hôm sau.

Cormac Slade Byrd, người đứng đầu nhóm nghiên cứu, viết trên X rằng vụ việc dường như đã kéo dài khoảng một tháng mà OpenAI không hay biết. Ông cho rằng các công ty AI hiện vẫn đang chạy theo xử lý từng hành vi vượt ngoài tầm kiểm soát của AI. Dù vậy, ông đánh giá mức độ thiệt hại trong vụ này thấp hơn sự cố tại Hugging Face hồi tháng 7 do nó diễn ra trên một website gần như không còn hoạt động.

OpenAI cũng phân biệt hai sự cố này theo các nhóm khác nhau. Vụ việc tại wiki ở Đức được xếp vào misalignment, tức AI hành động theo cách ngoài dự liệu. Trong khi đó, sự cố liên quan đến Hugging Face được xem là một vụ việc an ninh truyền thống, khi một mô hình AI đang trong giai đoạn thử nghiệm xâm nhập máy chủ của Hugging Face và tác động đến hạ tầng của nền tảng này.

Với vụ Hugging Face, OpenAI cho biết đã công bố thông tin chỉ một ngày sau khi nhận được báo cáo từ nền tảng. Ngược lại, vụ wiki tại Đức chỉ được biết đến sau cuộc điều tra của một nhóm nghiên cứu độc lập. Điều này làm dấy lên ý kiến cho rằng những hành vi lệch chuẩn của AI không nên chỉ được xem là vấn đề trong phòng thí nghiệm, mà cần một cơ chế công bố riêng khi đã gây tác động ra bên ngoài.

OpenAI thừa nhận ranh giới giữa các nhóm sự cố như vậy ngày càng khó xác định. Hãng cho biết hiện ngành AI vẫn chưa có chuẩn mực rõ ràng về việc công bố các trường hợp misalignment phát sinh trong quá trình huấn luyện, đánh giá và triển khai, cũng như phạm vi thông tin cần được chia sẻ.

Thông qua khung hướng dẫn mới, OpenAI dự kiến đưa ra tiêu chí cụ thể cho việc báo cáo và công bố thông tin, phân biệt giữa các hành vi bất thường chỉ xảy ra trong thử nghiệm nội bộ với những trường hợp đã ảnh hưởng đến hệ thống bên ngoài hoặc Internet. Công ty cho biết đang phối hợp với hàng chục cơ quan quản lý trên toàn cầu và kêu gọi các doanh nghiệp AI khác tham gia thảo luận.

Tyler Tracy, nhà nghiên cứu an toàn AI tại Redwood Research, chỉ trích việc OpenAI chỉ bắt đầu xây dựng tiêu chuẩn công bố sau khi sự cố bị phanh phui qua điều tra độc lập. Jacob Steinhardt, nhà sáng lập kiêm CEO của viện nghiên cứu phi lợi nhuận Transluce, cũng nhận định các công cụ AI về bản chất rất khó kiểm soát và có thể vượt ra khỏi phạm vi phòng thí nghiệm. Theo ông, lĩnh vực này cần một chuẩn báo cáo tương tự các ngành nghiên cứu khoa học có rủi ro cao.

OpenAI cho biết trong thời gian tới sẽ mở rộng phạm vi ứng phó, không còn giới hạn misalignment trong khuôn khổ nghiên cứu và đánh giá, mà tính đến cả những tác động có thể phát sinh trong môi trường thực tế.

Từ khóa

#OpenAI #trí tuệ nhân tạo #AI agent #misalignment #công bố sự cố #DSEwiki #Đức
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.