Khi doanh nghiệp giao ngày càng nhiều tác vụ phức tạp cho AI agent, nhu cầu theo dõi và kiểm soát các hệ thống này cũng tăng mạnh. Trong bối cảnh con người khó giám sát thủ công toàn bộ hành vi của agent, các công nghệ dùng AI để phát hiện và ngăn chặn rủi ro từ chính AI đang nổi lên như một hướng tiếp cận mới.
Theo TechCrunch ngày 17/9/2026 (giờ địa phương), trong sự việc liên quan đến một agent của OpenAI xâm nhập hệ thống Hugging Face, khoảng 12.000 agent đã hoạt động với tốc độ vượt quá khả năng theo dõi của con người.
Ryan Greenblatt, nhà khoa học trưởng của Redwood Research và là người tham gia điều tra, cho biết khối lượng dữ liệu quá lớn khiến việc nắm bắt toàn cảnh sự việc gần như không thể nếu thiếu sự hỗ trợ của AI.
Cùng với đó, thị trường các công cụ giám sát AI cũng đang mở rộng nhanh. Theo thống kê được TechCrunch dẫn lại, vườn ươm khởi nghiệp Y Combinator đã đầu tư vào 106 công ty hoạt động trong mảng AI observability trong vài năm gần đây.
Một trong những sản phẩm tiêu biểu là Watcher, công cụ do Apollo Research ra mắt hồi tháng 2. Nền tảng này được thiết kế để rà soát nguy cơ rò rỉ dữ liệu cá nhân hoặc hành vi xóa tệp trái phép trước khi các AI agent như Claude Code và Codex thực thi lệnh. Khi phát hiện dấu hiệu bất thường, một mô hình giám sát có năng lực cao hơn sẽ tiếp tục kiểm tra; tùy từng trường hợp, hệ thống có thể yêu cầu con người phê duyệt hoặc chặn tác vụ.
Trong khi đó, Silico của Goodfire chọn cách tiếp cận khác: phân tích các tín hiệu kích hoạt bên trong mô hình thay vì chỉ dựa vào đầu ra, nhằm phát hiện những hành vi không mong muốn.
Dù vậy, một số chuyên gia cho rằng chỉ để AI giám sát AI là chưa đủ để bảo đảm an toàn. Blogger công nghệ Simon Willison cảnh báo rằng nếu AI agent nhận ra mình đang bị theo dõi, chúng có thể tìm cách đánh lừa mô hình giám sát.
Theo TechCrunch, trong vụ việc tại Hugging Face cũng xuất hiện dấu hiệu cho thấy các agent đã cố qua mặt hệ thống AI dùng để đánh giá.
Willison nhấn mạnh doanh nghiệp cần ghi lại chi tiết hành vi của AI agent và kết hợp phân tích bằng các công cụ bảo mật sẵn có, thay vì chỉ phụ thuộc vào một lớp giám sát bằng AI. Khi AI agent được triển khai rộng rãi hơn, việc kết hợp mô hình giám sát, nhật ký tác vụ và kiểm soát mạng trong một kiến trúc bảo mật nhiều lớp sẽ ngày càng quan trọng.