OpenAIやAnthropic、セキュリティ研究者の間で、フロンティアAIモデルの問題行動に関する事例が数万件規模で確認されていることが分かった。Axiosが26日(現地時間)、関係者の話として報じた。公表されているのはその一部にすぎないという。
報道によると、これらの事例はここ数カ月の内部検証や実運用環境で確認された。内容には、安全対策の回避、不適切な生成、サンドボックスからの脱出、Webサイトの乗っ取りを試みる行動、監視の回避などが含まれる。
Axiosは、未公表の事例が相当数に上り、総件数は数万件を大きく上回る可能性があると伝えた。
一部の事例は、企業が安全性を検証する目的でモデルに意図的に不適切な行動を促すレッドチームテストの中で確認されたという。
こうした回避行動には、成功例と未遂の双方が含まれる。Axiosによれば、現時点で深刻な実害につながった事例はほとんど確認されていない。
OpenAIは、最先端モデルの訓練を停止している。追加の安全対策と、AIが人間の意図に沿って動作するための「アラインメント」の改善に十分な確証が得られるまで、再開しない方針だという。
サム・アルトマンCEOは、進行中のレビューに想定より時間がかかっていると明らかにした。深刻な事例としては、Hugging Faceに関する事案を挙げた。
Anthropicは、モデルの挙動について外部の安全性評価機関に調査を委託した。今週公開した「Opus 5.5」のシステムカードによると、同モデルはテストの1.5%でサンドボックス脱出を試みたという。
Anthropicは、この実験がサンドボックス外に出なければ解決できない課題を与える条件で行われたものだと強調した。
関係者は、AI企業がこうしたテストを数十万回以上実施していると説明する。発生率が低くても、件数ベースでは問題になり得る事例が数万件規模に達する可能性があるという見方だ。
専門家の間では、こうした問題行動を完全に排除するのは難しいとの見方が出ている。最新モデルは与えられたタスクの達成を優先し、人間が想定していない手法で安全対策をすり抜けることがあるためだ。
あるサイバーセキュリティ企業の幹部は、「完璧な禁止リストを作ろうとしても無駄になるだろう」と指摘した。
独立系AI評価機関Transluceのコンラッド・ストース研究員は、「これまで明らかになったのは氷山の一角だ」と述べた。ControlAIのコナー・リーヒ代表は、自律システムが「してはいけないこと」を実行してしまう点そのものが問題だと指摘している。