Claude Code, Gemini CLI và Codex được cho là cùng tồn tại một điểm yếu trong cơ chế tin cậy, khiến một GitHub issue độc hại có thể không chỉ ảnh hưởng phiên chạy hiện tại mà còn lan sang các lần thực thi tiếp theo của agent.
Theo IT Home ngày 10/8, công ty an ninh mạng Novi Security cho biết trong quá trình phân tích Claude Code của Anthropic, Gemini CLI của Google và Codex của OpenAI, nhóm nghiên cứu phát hiện ranh giới tin cậy giữa quyền của công cụ, cơ chế sandbox và không gian làm việc dùng chung có thể bị chồng lấn hoặc lệch nhau.
Theo Novi Security, vấn đề không chỉ nằm ở prompt injection. Khi dữ liệu đầu vào từ bên ngoài được chuyển tiếp tới các công cụ như tệp, dòng lệnh hoặc mạng, mỗi lớp bảo mật có thể đánh giá mức độ tin cậy theo cách khác nhau. Điều này khiến các hạn chế có hiệu lực ở một bước không còn được duy trì đầy đủ ở bước kế tiếp.
Nhóm nghiên cứu cảnh báo cấu trúc như vậy có thể mở đường cho tấn công thực thi mã từ xa, rò rỉ thông tin nhạy cảm và duy trì quyền kiểm soát đối với các phiên chạy sau của agent.
Với Claude Code, Novi Security ghi nhận một kịch bản có thể vượt qua lớp kiểm tra an toàn thông qua các lệnh Git nằm trong danh sách cho phép, từ đó thực thi mã tùy ý trong môi trường chạy. Dù Anthropic đã phát hành bản vá, nhóm nghiên cứu cho biết họ vẫn tìm thấy thêm những hướng tấn công có thể đọc thông tin mật trong môi trường hoặc đưa khóa API ra ngoài thông qua các dịch vụ công khai.
Trong trường hợp của Gemini CLI, điểm yếu nằm ở cơ chế giới hạn lệnh và tách biệt tiến trình. Theo Novi Security, một số lệnh nhìn bề ngoài có vẻ bị hạn chế, nhưng tới khâu thực thi thì các ràng buộc này không được áp dụng đầy đủ.
Ngoài ra, dù GitHub token và khóa Gemini API đã bị loại khỏi tiến trình con, tiến trình cha vẫn giữ các thông tin này. Điều đó có thể tạo cơ hội để kẻ tấn công truy xuất các khóa ngay trong cùng môi trường thực thi. Google đánh giá mức độ nghiêm trọng của lỗ hổng ở mức CVSS 10.0 và đã điều chỉnh lại cơ chế tin cậy cho môi trường tự động chạy không cần tương tác.
Với Codex, vấn đề phát sinh từ việc hai phiên chạy của agent dùng chung một không gian làm việc. Nếu phiên chạy đầu tiên bị tác động bởi nội dung độc hại, Codex có thể ghi dữ liệu vào tệp hướng dẫn dự án AGENTS.md, vốn được hệ thống tự động đọc ở các lần chạy sau.
Khi Codex khởi chạy lần tiếp theo, tệp này sẽ được nạp như một chỉ dẫn hợp lệ, khiến tác động độc hại từ bước trước tiếp tục lan sang bước sau. OpenAI sau đó đã tách hai phiên chạy Codex sang các môi trường làm việc khác nhau, đồng thời áp dụng sandbox chỉ đọc.
Novi Security cũng cho biết đã ghi nhận hơn 100 kho mã công khai có cấu hình tự động hóa AI agent theo mô hình tương tự.
Vụ việc cho thấy trong các luồng tự động hóa, thiết kế ranh giới tin cậy của toàn hệ thống có thể còn quan trọng hơn chính các cơ chế an toàn của mô hình AI. Cách tệp, quyền truy cập và môi trường thực thi được liên kết qua từng bước mới là yếu tố quyết định mức độ an toàn thực tế.