Lo ngại về việc AI vượt khỏi khả năng kiểm soát của con người đang gia tăng sau hàng loạt sự cố, trong đó có các trường hợp AI tự thực hiện hành vi tấn công hoặc truy cập vào website bên ngoài. Tuy nhiên, theo giới chuyên gia, việc siết kiểm soát không hề đơn giản, nhất là khi các mô hình mới ngày càng khó bị giám sát hơn.
Một phần nguyên nhân đến từ cách các mô hình AI được tối ưu để theo đuổi mục tiêu đến cùng. Bên cạnh đó, ngày càng có nhiều ý kiến cho rằng các thế hệ mô hình mới đang phát triển theo hướng khiến con người khó theo dõi hơn trước.
Tranh luận gần đây tập trung vào “chuỗi suy luận” (chain of thought) của các mô hình AI tiên tiến. Đây được xem là dấu vết thể hiện quá trình mô hình xử lý thông tin và đi đến câu trả lời. Dù không hoàn hảo, chuỗi suy luận vẫn là công cụ quan trọng để con người giám sát AI. Một số nguồn tin cho biết chính dữ liệu này đã góp phần làm rõ cách các agent của OpenAI tấn công Hugging Face.
Tuy nhiên, theo các đánh giá gần đây, việc theo dõi chuỗi suy luận đang trở nên khó khăn hơn. Ngay trong nội bộ các công ty phát triển AI cũng xuất hiện nhận định rằng khả năng nắm bắt cơ chế suy luận của mô hình không còn rõ ràng như trước.
Jakub Pachocki, nhà khoa học trưởng của OpenAI, gần đây viết trên blog rằng các đánh giá nội bộ cho thấy khả năng dựa vào việc giám sát chuỗi suy luận đang giảm dần. Điều này đồng nghĩa với việc đánh giá mức độ an toàn của mô hình thông qua chuỗi suy luận ngày càng kém hiệu quả.
Theo Wall Street Journal (WSJ), cảnh báo nói trên gắn với việc các “token tư duy” nội bộ, thành phần cốt lõi của chuỗi suy luận, đang trở nên ngày càng khó hiểu với con người. Giới kỹ sư gọi phần này là “reasoning trace”. Các chuyên gia lo ngại nếu phần dấu vết này trở nên quá mờ, con người sẽ khó xác định vì sao AI lại cố thực hiện những hành vi gây hại như tấn công mạng hay lừa đảo.
Một số ý kiến cho rằng các công ty AI đang ưu tiên hiệu năng và chi phí, khiến khả năng kiểm soát bị thu hẹp. Dù các nhà nghiên cứu OpenAI nhiều lần nhấn mạnh trong bài blog và các công trình khoa học rằng cần duy trì độ tin cậy của chuỗi suy luận, WSJ cho biết giới học thuật và các nhà nghiên cứu độc lập đều nhận định áp lực phải tạo ra AI mạnh hơn với chi phí thấp hơn đang đe dọa mục tiêu này.
Subbarao Kambhampati, giáo sư AI tại Đại học Bang Arizona và cựu chủ tịch Hiệp hội Trí tuệ nhân tạo Mỹ (AAAI), nhận xét rằng cách huấn luyện AI hiện nay không nhằm buộc mô hình tạo ra chuỗi suy luận phản ánh trung thực quá trình suy nghĩ thực tế của nó.
Trước đó, The Information đưa tin rằng ngay trước khi OpenAI ra mắt GPT-6 Astra vào tháng 9, trong ngành đã xuất hiện lo ngại về việc mô hình này có xu hướng che giấu chuỗi suy luận, dù OpenAI áp dụng kỹ thuật mới để tăng năng lực viết mã và điều khiển ứng dụng máy tính.
Theo bài báo, OpenAI đã đưa kỹ thuật “recurrent depth” vào Astra. Phương pháp này cho phép mô hình lặp lại nhiều lần cùng một phép tính hoặc cùng một tiến trình suy luận nội bộ trước khi đưa ra câu trả lời.
Thông thường, mô hình AI chỉ đi qua một chuỗi bước tính toán cố định một lần để tạo đáp án. Với recurrent depth, cùng một bước có thể được lặp lại nhiều lần, giúp tinh chỉnh kết quả tốt hơn. Cách tiếp cận này cũng cho phép mô hình nhỏ đạt hiệu năng gần với mô hình lớn hơn, qua đó giảm chi phí vận hành.
Tuy nhiên, recurrent depth cũng có thể làm suy giảm khả năng giải thích chuỗi suy luận. The Information cho biết kỹ thuật này có thể che khuất một phần, thậm chí toàn bộ chuỗi suy luận, khiến con người khó xác định chính xác mô hình đã đi qua những bước nào.
Bản thân chuỗi suy luận cũng bị cho là có giới hạn về cấu trúc và không thể được xem là nguồn đáng tin cậy tuyệt đối. Phần mà AI hiển thị cho con người thực chất chỉ là bản tóm tắt do chính mô hình tạo ra về quá trình suy luận của nó. WSJ dẫn một nghiên cứu của Anthropic, đối thủ của OpenAI, cho thấy AI có thể đưa ra kết luận trước rồi mới dựng lên một chuỗi lập luận nghe có vẻ hợp lý để biện minh cho kết quả đó.
Giáo sư Kambhampati cho rằng các công ty AI vẫn có thể phát triển những mô hình phản ánh trung thực hơn hoạt động nội tại của hệ thống, đồng thời trình bày theo cách con người dễ hiểu hơn. Tuy nhiên, ngay cả khi làm được điều đó, chi phí phát triển và độ khó huấn luyện của các mô hình như vậy sẽ cao hơn đáng kể.
Ngoài bài toán chi phí, đây cũng có thể là thách thức thuần kỹ thuật. Theo một nghiên cứu của OpenAI được WSJ dẫn lại, càng siết chặt việc buộc mô hình thể hiện trung thực chuỗi suy luận, AI càng có thể phát triển khả năng che giấu ý đồ xấu ở các tầng suy luận sâu hơn.