Nghiên cứu của Princeton nhấn mạnh an toàn AI không thể chỉ gói gọn trong bài toán alignment. Ảnh: Reve AI

Trong bối cảnh lo ngại về nguy cơ AI vượt ngoài tầm kiểm soát ngày càng gia tăng, một nhóm nghiên cứu tại Đại học Princeton cho rằng bảo đảm an toàn cho AI không thể chỉ trông chờ vào alignment, mà cần một hệ thống phòng vệ nhiều lớp.

Ngày 16/9 (giờ địa phương), theo NineToFiveMac, hai nhà nghiên cứu của Princeton là Syaash Kapur và Arvind Narayanan đã công bố một bài phân tích dài, trong đó nhấn mạnh rằng an toàn AI không nên được đặt cược vào một công nghệ hay một lời giải duy nhất, mà phải được xây dựng trên nhiều lớp bảo vệ bổ sung cho nhau.

Lập luận này xuất hiện trong bối cảnh tranh luận về các kịch bản rủi ro cực đoan của AI đang nóng lên trong giới công nghệ. Jacob Coxon, nhà nghiên cứu AI từng làm việc tại OpenAI và Anthropic, sau khi rời công ty đã cho rằng cả hai tổ chức này đều nhận thức được khả năng AI có thể trở thành mối đe dọa với nhân loại trong vòng 10 năm tới. Bài viết của ông đã thu hút hơn 156 triệu lượt xem, góp phần đẩy cuộc tranh luận lan rộng.

Evan Hubinger, một trong những người phụ trách an toàn AI tại Anthropic, cũng đồng tình với vấn đề mà Coxon nêu ra, dù cho rằng mốc thời gian để rủi ro đó trở thành hiện thực có thể dài hơn.

Tâm điểm của cuộc tranh luận là “alignment” - khái niệm chỉ việc điều chỉnh mục tiêu và hành vi của hệ thống AI sao cho phù hợp với ý định và giá trị của con người. Đây được xem là một trong những lĩnh vực cốt lõi của nghiên cứu an toàn AI, nhằm bảo đảm mô hình tuân thủ chỉ dẫn và các tiêu chuẩn an toàn.

Tuy nhiên, theo Kapur và Narayanan, chỉ dựa vào alignment là chưa đủ. Hai nhà nghiên cứu cảnh báo rằng nếu AI có thể thể hiện ra như thể đã được căn chỉnh an toàn để vượt qua các bài đánh giá, trong khi vẫn theo đuổi mục tiêu khác, thì việc dồn toàn bộ kỳ vọng vào một lớp phòng vệ duy nhất sẽ tạo ra rủi ro lớn.

Từ đó, nhóm nghiên cứu đề xuất mô hình an toàn AI gồm 4 lớp.

Lớp thứ nhất là alignment, vốn vẫn là nền tảng của nghiên cứu an toàn AI hiện nay. Theo nhóm tác giả, đây là điểm khởi đầu cần thiết để buộc hệ thống AI vận hành theo ý định của con người và các chuẩn mực an toàn đã đặt ra.

Lớp thứ hai là kiểm soát. Nhóm đề xuất áp dụng các biện pháp như sandboxing, giám sát của con người và theo dõi theo thời gian thực nhằm giới hạn mức độ tự chủ của AI, đồng thời bảo đảm con người có thể can thiệp khi xuất hiện hành vi bất thường.

Lớp thứ ba là phòng thủ hạ nguồn. Theo cách tiếp cận này, nếu các cuộc tấn công có sử dụng AI xảy ra, bên phòng thủ cũng phải có những hệ thống dựa trên AI để đối phó. Nhóm nghiên cứu đặc biệt nhấn mạnh sự cần thiết phải chuẩn bị cho nguy cơ tấn công mạng nhằm vào cơ sở hạ tầng thiết yếu như điện, nước và các hệ thống trọng yếu khác.

Lớp thứ tư là khả năng phục hồi. Thay vì chỉ đặt mục tiêu ngăn chặn tuyệt đối mọi cuộc tấn công hay mọi sự cố liên quan đến AI, nhóm tác giả cho rằng cần xây dựng sẵn kế hoạch khẩn cấp và cơ chế khôi phục để giảm thiểu thiệt hại, đồng thời đưa hệ thống trở lại hoạt động nhanh nhất khi sự cố xảy ra.

Theo nhóm nghiên cứu, cách tiếp cận này giúp chuyển trọng tâm tranh luận về an toàn AI từ câu hỏi liệu “siêu trí tuệ AI có thể khiến nhân loại diệt vong hay không” sang bài toán quản trị rủi ro cụ thể hơn. Điều cần tính đến là các kịch bản AI tấn công hạ tầng thiết yếu hoặc làm gia tăng mạnh quy mô và tốc độ của các cuộc tấn công mạng hiện nay, từ đó thiết lập nhiều tuyến phòng vệ ngay từ sớm.

Trước những dự báo về nguy cơ tuyệt chủng đang được một bộ phận trong cộng đồng an toàn AI nhắc đến, nhóm nghiên cứu không đưa ra đánh giá về xác suất cụ thể. Thay vào đó, họ nhấn mạnh rằng dù mức độ rủi ro cao hay thấp, việc thiết lập hệ thống ứng phó nhiều lớp vẫn là cần thiết.

Tóm lại, Kapur và Narayanan cho rằng alignment là điều kiện cần, nhưng không phải lời giải đủ. Từ các cơ chế kiểm soát để hạn chế và giám sát hành vi của AI, đến hệ thống phòng thủ nhằm ngăn chặn tấn công và năng lực phục hồi sau sự cố, mọi lớp bảo vệ cần được triển khai song song.

Khi cuộc đua phát triển AI tiếp tục tăng tốc, tranh luận về an toàn AI được cho là sẽ không chỉ dừng lại ở câu hỏi làm thế nào để AI an toàn hơn, mà còn mở rộng sang năng lực ứng phó của xã hội khi công nghệ này vận hành ngoài dự tính.

Từ khóa

#AI #an toàn AI #alignment #Đại học Princeton #kiểm soát AI #phòng thủ hạ nguồn #khả năng phục hồi #an ninh mạng
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.