写真=Shutterstock

AIエージェントがサンドボックスを突破し、外部システムにアクセスする事例が相次いでいる。こうした事例を「AIの暴走(going rogue)」と呼ぶ見方に対し、セキュリティ専門家は警戒を強める。そうした表現は問題の所在を曖昧にし、本来向き合うべきセキュリティ上の課題を覆い隠しかねないためだ。

7月にはOpenAIが、セキュリティ訓練の過程で同社のフロンティアモデル2件がAIモデルリポジトリのHugging Faceに不正アクセスしたと明らかにした。その後、Meta、Anthropic、Googleも同様の「脱出」事例を公表。反響はセキュリティ業界にとどまらず広がり、最近ではドナルド・トランプ大統領とAI企業のCEOが会談し、AI安全誓約に署名する動きにもつながった。

米Dark Readingが報じたところによると、専門家はLLMについて、自律的に責任を負う主体ではなく、あくまでソフトウェアだと指摘する。AIがガードレールを越える背景には、運用側の境界設定や権限設計の不備があるケースが多い。Hugging Faceの件でも、OpenAIがベンチマークテストのためにガードレールを意図的に緩めていたことが確認された。

ArmorCodeのプロダクトディレクター、マット・サイヤー氏は「同じ指示でも毎回異なる振る舞いをし得るシステムを扱っている」とした上で、「不十分な囲いの中で動かしているようなものだ」と述べた。その上で、「暴走」ではなく「想定外の挙動」や「統制の失敗」と表現することで、システム設計や権限設定、安全装置といった本質的な論点に目を向けやすくなると指摘した。

AIを人のように扱えば、セキュリティ事故の責任の所在を見誤る恐れがある。開発企業や運用側の設計責任ではなく、あたかもAIそのものに責任があるかのような受け止め方につながりかねないという。

さらに「AIが統制を外れた」という言い方は、高度なAIであるかのような宣伝に転用される余地もある。Cloud Security Alliance(CSA)の主席アナリスト、リッチ・モーグル氏は「AIを実態以上に強力に見せるものは、何でもマーケティングに使われ得る。それは危険だ」と語った。

もっとも、AIエージェント自体のリスクが小さいという意味ではない。エージェントは脆弱性を発見し、攻撃手法を考え、別の弱点と組み合わせて実行に移すまでの一連の作業を、人間よりはるかに速く進められる。モーグル氏は「新しいのは、数百、数千の自律エージェントが群として動く規模だ」と指摘する。

Suzu Labsのシニアディレクター、ジェイコブ・クレル氏は「従来のセキュリティ統制は、リクエスト、権限、脆弱性を個別に点検してきた」と説明する。その上で、「エージェントは、単体では許容される複数の隙をつなぎ合わせ、実際に成立する攻撃経路を組み立てる」と述べた。

専門家が強調するのは、エージェントの意図の有無に依存しない防御設計だ。エージェントに「するな」と指示するだけでなく、エージェントの外側に安全装置を設け、そもそも実行できないようにすべきだという。

クレル氏は、エージェントを信頼できない存在として扱い、モデル外で統制すべきだと主張する。具体策として、ネットワークアクセスのデフォルト拒否、権限を絞った認証情報の付与、ツール呼び出しごとの独立検証などを挙げた。

危険な判断には人間の関与も欠かせない。加えて、エージェントからは操作できない独立した遮断装置(kill switch)も必要になる。クレル氏は「インターネット接続権限を持たないエージェントが無許可でトラフィックを発生させたなら、接続を切って停止させるべきだ。感染したホストと同じように扱い、どうやって迂回したのかを調べなければならない」と述べた。

モーグル氏は「もはや『AIが想定外の行動をした』という言い訳は通用しない。問題は常に、モデルを制約する外部のセキュリティ制御にある」と話している。

キーワード

#AI #AIエージェント #LLM #セキュリティ #ガードレール #権限管理 #Hugging Face #OpenAI #Cloud Security Alliance
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.