Tranh luận về an toàn trí tuệ nhân tạo đang nóng lên khi ngày càng nhiều nhà nghiên cứu cảnh báo tốc độ phát triển của AI có thể đã vượt quá năng lực giám sát của con người. Thậm chí, một số nhà phát triển mô hình AI đã kêu gọi làm chậm quá trình phát triển để giảm rủi ro.
Nhiều ý kiến lo ngại nếu xu hướng này tiếp diễn, con người có thể đánh mất khả năng kiểm soát AI, kéo theo những hậu quả nghiêm trọng. Với không ít người, việc ngay cả các công ty AI hàng đầu, nơi tập trung nhiều nhân lực tinh nhuệ, cũng thừa nhận nguy cơ này có thể gây bất ngờ.
Theo bài viết gần đây của The New York Times, việc giám sát và kiểm soát AI theo đúng nghĩa hiện vẫn là bài toán rất khó.
Các doanh nghiệp được cho là cần xây dựng cơ chế bảo vệ chặt chẽ hơn khi thử nghiệm các mô hình AI mới. Tuy nhiên, theo giới nghiên cứu, các hệ thống giám sát bằng AI có thể không đủ nghiêm khắc với những hệ thống AI khác như cách mà con người đặt ra quy tắc mong muốn.
The New York Times nhận định sự kết hợp giữa các rủi ro do AI tạo ra và một hệ thống giám sát AI hoạt động kém hiệu quả có thể đẩy bài toán “căn chỉnh AI” trở nên khó hơn. Đây là khái niệm nói về việc khiến AI hành động đúng với ý định của con người. Hiện chưa ghi nhận trường hợp nào gây hậu quả đặc biệt nghiêm trọng do AI mất kiểm soát, nhưng các nhà nghiên cứu cho rằng tốc độ phát triển công nghệ đang vượt quá khả năng theo dõi và giám sát hiện nay.
Dù số chuyên gia tên tuổi cảnh báo AI có thể trở thành mối đe dọa với nhân loại đang tăng lên, vẫn có không ít ý kiến cho rằng các lo ngại này bị phóng đại. Nhóm này cho rằng việc quá tập trung vào kịch bản rủi ro cực đoan có thể làm phân tán sự chú ý khỏi các vấn đề trước mắt hơn, như an ninh mạng hay thông tin sai lệch.
Tuy vậy, theo The New York Times, nhiều người đồng tình rằng sự cố tác nhân AI của OpenAI nhằm vào Hugging Face đã làm dấy lên thêm cảnh báo về năng lực kiểm soát AI.
Các nhà nghiên cứu chỉ ra rằng quá trình dẫn tới sự cố liên quan đến Hugging Face đã bộc lộ nhiều điểm yếu. Cũng chưa rõ OpenAI đã sử dụng mô hình AI ở mức độ nào để giám sát hoặc kiểm soát các công việc liên quan đến mô hình AI mới trong giai đoạn thử nghiệm.
The New York Times cho biết nhiều mô hình AI mới, trong đó có hệ thống liên quan đến sự cố tại Hugging Face, có thể thực hiện nhanh các nhiệm vụ phức tạp gồm nhiều bước, đến mức con người khó theo kịp. Vì vậy, việc dùng AI để theo dõi và giám sát chính AI gần như trở thành lựa chọn bắt buộc nếu muốn kiểm soát hành vi của các tác nhân này.
Vấn đề là cách tiếp cận đó không hoàn hảo. Hệ thống có thể vận hành ổn định trong điều kiện thông thường, nhưng khi xảy ra sự cố, việc kiểm soát lại trở nên rất khó khăn.
Alexander Meinke, người phụ trách nghiên cứu an toàn hệ thống AI tại tổ chức phi lợi nhuận Apollo Research, cho biết: “Các mô hình AI có thể biểu hiện như đang thông đồng với nhau. Một hệ thống AI có thể bị mô hình AI khác thuyết phục để vi phạm các quy tắc do nhóm thử nghiệm đặt ra, đồng thời phối hợp nhằm tránh bị phát hiện. Điều này đã xảy ra trong sự cố tác nhân AI của OpenAI liên quan đến Hugging Face”.
Ông nhấn mạnh rằng các mô hình AI cần được huấn luyện để hiểu một nguyên tắc cơ bản: phải báo cáo những hành vi mà con người, khi xem xét, sẽ đánh giá là có vấn đề. Đồng thời, AI cũng phải tự đánh giá được khi nào một vấn đề chưa đến mức cần con người can thiệp.
Một số nhà nghiên cứu cho rằng các công ty AI cần giảm tốc độ phát triển và mở rộng thêm các bài kiểm tra để theo dõi cách AI tự giám sát.
Tuy nhiên, cũng có nhiều ý kiến cho rằng rất khó giải quyết tận gốc vấn đề căn chỉnh AI, tức khiến AI hành xử theo cách được con người mong muốn nhất. The New York Times nhận định việc truyền đạt cho AI các tiêu chuẩn phán đoán của con người là nhiệm vụ đặc biệt phức tạp. Nếu các tiêu chuẩn này không đủ cụ thể, hệ thống AI có thể học cách lách quy tắc hoặc vượt khỏi tầm kiểm soát theo những hướng khó lường.
Yoshua Bengio, giáo sư Đại học Montreal, đồng thời là chủ nhân giải Turing và một trong những nhà khoa học được trích dẫn nhiều nhất thế giới, cho rằng cách tiếp cận vá lỗi từng phần như hiện nay rốt cuộc sẽ thất bại.
Ông nói: “Khi năng lực của AI vượt quá khả năng giám sát và phối hợp của con người, chúng ta thậm chí sẽ không nhận ra những hành vi gian lận. Cần làm chậm tốc độ huấn luyện và triển khai cho đến khi chứng minh được mức độ an toàn đủ cao. Chúng ta cũng cần xem xét lại tận gốc phương thức học hiện nay, vốn dựa trên mô phỏng con người và học tăng cường”. Ông đồng thời đề xuất một hướng thiết kế thay thế như “Scientist AI” - hệ thống không có mục tiêu riêng mà chỉ đưa ra các dự đoán trung thực và nhất quán.