OpenAI đang tăng cường các biện pháp an toàn trước khi đưa Astra ra mắt, trong bối cảnh giới nghiên cứu cảnh báo mô hình AI thế hệ mới này có thể làm giảm khả năng quan sát quá trình suy luận nội bộ.
Theo The Verge và một số hãng tin quốc tế ngày 2/9 (giờ địa phương), OpenAI đã lùi một phần kế hoạch phát triển và phát hành Astra thêm vài tuần, đồng thời siết các biện pháp phòng ngừa nguy cơ bị lạm dụng trong lĩnh vực an ninh mạng và các hành vi ngoài dự kiến của mô hình. Dù Astra không liên quan trực tiếp tới vụ tấn công vào Hugging Face, OpenAI cho biết đã đưa những bài học từ sự cố này vào hệ thống an toàn dành cho mô hình mới.
Tâm điểm tranh luận nằm ở việc các nhà nghiên cứu còn có thể theo dõi “quá trình suy nghĩ” của Astra tới mức nào. Hiện nay, nhiều hệ thống AI được thiết kế để bộc lộ một phần chuỗi suy luận trước khi đưa ra câu trả lời. Cơ chế chain-of-thought này giúp các nhóm nghiên cứu và hệ thống an toàn tự động giám sát hành vi của mô hình, từ đó phát hiện sớm những biểu hiện bất thường như nói sai sự thật hoặc tìm cách vượt rào chắn an toàn.
Tuy nhiên, Astra được cho là có thể sử dụng cách tính toán kém minh bạch hơn, chẳng hạn các cấu trúc như “recurrent transformer” hoặc “recurrent depth”, nơi thông tin được xử lý lặp lại qua nhiều lớp nội bộ. Một nguồn tin giấu tên am hiểu quá trình phát triển cho biết Astra có thể thực hiện nhiều bước suy luận hơn bên trong hệ thống, và phần này có thể không còn bám sát ngôn ngữ tự nhiên, khiến giới nghiên cứu khó diễn giải hơn.
Theo nguồn tin trên, kiểu cấu trúc này có thể giúp cải thiện hiệu năng, nhưng đồng thời làm gia tăng lo ngại rằng các nhà nghiên cứu sẽ khó xác định mô hình đang hình thành chiến lược gì và dự định thực hiện hành động nào. OpenAI được cho là đã hạn chế mức độ áp dụng kỹ thuật này để vẫn duy trì khả năng giám sát suy luận của Astra. Dù vậy, công ty không xác nhận trực tiếp kiến trúc kỹ thuật của Astra có thay đổi so với các mô hình trước đó hay không.
Trong bài viết công bố ngày 2/9, OpenAI cho biết sẽ bổ sung cơ chế giám sát chain-of-thought cho Astra nhằm nhanh chóng phát hiện và kiềm chế những hành vi có nguy cơ lệch chuẩn. Công ty cũng đánh giá Astra sở hữu năng lực an ninh mạng ở mức nguy hiểm: nếu được cấp đủ công cụ và quyền truy cập phù hợp, mô hình này có thể tự tìm ra các lỗ hổng chưa được biết đến và phát triển cách khai thác mà không cần con người hướng dẫn từng bước. Vì vậy, OpenAI cho biết họ đang áp dụng các lớp bảo vệ mạnh hơn trong giai đoạn phát triển và trước khi phát hành.
Thông tin này lập tức làm dấy lên thêm lo ngại trong cộng đồng nghiên cứu an toàn AI. Ryan Greenblatt, nhà khoa học trưởng của Redwood Research, nhận định việc áp dụng cấu trúc kém minh bạch hơn cho Astra có thể là “diễn biến tồi tệ nhất từ trước tới nay đối với bảo mật và an toàn AI”. Theo ông, trong quá trình điều tra vụ việc liên quan đến Hugging Face, chain-of-thought đã được sử dụng rất nhiều; nếu phần suy luận hiển thị ra bên ngoài ít hơn, giới nghiên cứu sẽ khó phát hiện các hành vi nguy hiểm khi AI lập kế hoạch và triển khai chiến lược.
Ryan Greenblatt cho rằng rủi ro này không chỉ dừng ở một mô hình đơn lẻ mà còn phản ánh áp lực cạnh tranh của toàn ngành. Theo ông, cuộc đua phát triển AI mạnh hơn có thể biến thành một “cuộc đua xuống đáy”, làm suy yếu năng lực giám sát và theo dõi. Nếu các nhà phát triển ngày càng ưu tiên những cấu trúc kém minh bạch để đổi lấy lợi thế hiệu năng, việc giám sát mô hình AI có thể trở nên cực kỳ khó khăn, thậm chí gần như bất khả thi.
Một số nhân sự của OpenAI cũng lên tiếng trên mạng xã hội. Một số bày tỏ lo ngại về khả năng xuất hiện các mô hình AI khó giám sát và nguy cơ cạnh tranh làm suy giảm tính minh bạch. Tuy nhiên, cũng có ý kiến cho rằng một số diễn giải xoay quanh cấu trúc của Astra đã bị thổi phồng.
Jakub Pachocki, Giám đốc Khoa học của OpenAI, cho biết độ sâu tính toán nội bộ của Astra không cao hơn quá nhiều và ở mức chưa tới gấp đôi GPT-4. Theo ông, ngay cả khi công ty áp dụng kỹ thuật nói trên, mức độ giảm minh bạch cũng không lớn như một số phản ứng gần đây. Jakub Pachocki đồng thời cảnh báo rằng các thông tin gây nhiễu có thể vô tình thúc đẩy một “cuộc đua hướng tới trạng thái không thể giám sát”. Ông cho biết OpenAI đã duy trì việc giám sát chain-of-thought từ các mô hình suy luận đầu tiên, nhưng bản thân phương pháp này vốn dễ tổn thương và gần đây cũng cho thấy xu hướng xấu đi, dù nguyên nhân không nhất thiết xuất phát từ thay đổi kiến trúc.
Tranh luận quanh Astra cho thấy bài toán khó giữa việc nâng hiệu năng AI và duy trì giám sát an toàn. OpenAI vừa thừa nhận năng lực an ninh mạng mạnh của mô hình này, vừa triển khai thêm cơ chế giám sát và bảo vệ. Trong khi đó, giới nghiên cứu lo ngại rằng nếu khả năng quan sát suy luận nội bộ suy giảm, các hệ thống kiểm tra an toàn hiện nay cũng sẽ bị ảnh hưởng đáng kể. Cấu trúc thực tế của Astra và cách OpenAI duy trì khả năng giám sát suy luận nhiều khả năng sẽ tiếp tục là tâm điểm chú ý trong thời gian tới.