画像=Reve AI

OpenAIが開発を進める次世代AIモデル「Astra」を巡り、安全対策の強化と推論過程の可視性低下への懸念が同時に浮上している。OpenAIはサイバー悪用への備えを拡充した一方、AI安全研究者の間では、モデル内部の推論が従来より見えにくくなれば監視の実効性が損なわれかねないとの見方が広がっている。

The Vergeなど海外メディアによると、OpenAIはAstraの開発・投入の一部を数週間遅らせ、サイバー悪用や未承認の挙動に対する保護措置を強化した。AstraがHugging Faceのハッキング事案に直接関与したわけではないものの、同社はこの事案から得た教訓をAstraの安全対策に反映したと説明している。

論点の一つは、研究者がAstraの思考過程をどこまで検証できるかだ。現在の主要なAIシステムでは、回答前の推論過程を一定程度示せる設計が可能とされる。この「Chain of Thought」は、研究者や自動化された安全システムがモデルの挙動を監視し、虚偽の出力や安全装置の回避といった望ましくない行動を事前に検知する手掛かりとして活用されてきた。

一方、Astraは、情報が内部層を繰り返し通過する反復型トランスフォーマーのような、より不透明な方式を採用する可能性があると指摘されている。開発状況を知る匿名の関係者は、Astraではより多くの推論がシステム内部で処理され、その過程も研究者が理解しやすい自然言語から離れる可能性があると述べた。

こうした構造は性能向上に寄与し得る半面、モデルがどのような戦略を立て、何をしようとしているのかを研究者が把握しにくくなる懸念もある。報道では、OpenAIが研究者による継続的な監視を可能にする目的で、この技術の利用を制限したとも伝えられた。ただ、Astraの技術基盤が既存モデルから変わったかどうかについて、OpenAIは直接確認していない。

OpenAIは2日に公開したブログで、Astraに追加のChain of Thoughtモニタリングを適用し、アラインメントに反する可能性のある挙動を迅速に検知・抑制すると公表した。また、Astraについて、適切なツールとアクセス権限があれば、人間が各段階を逐一誘導しなくても未知の脆弱性を見つけ、悪用手法を開発し得る危険なレベルのサイバー能力を持つと評価。そのため、開発・投入前の段階から、より強力な保護措置を講じていると説明した。

こうした内容が伝わったことで、AI安全研究者の警戒感も強まっている。Redwood Researchの主任科学者、ライアン・グリーンブラット氏は、より不透明な構造をAstraに適用する判断について、「これまでのAIのセキュリティと安全性の観点で最悪の展開になり得る」と指摘した。

同氏は、Hugging Face事案の調査でもモデルのChain of Thoughtが大きな役割を果たしたと説明。推論過程が見えにくくなれば、AIが戦略を立てて実行に移す過程で危険な行動を研究者が見つけるのは格段に難しくなると警告した。

懸念は個別モデルにとどまらない。グリーンブラット氏は、より高性能なAIを目指す競争が、監督やモニタリング能力を弱める「底辺への競争」につながりかねないと指摘する。各社が性能面の優位を求めて不透明な構造を採用すれば、最終的にはAIモデルの監視が極めて困難になり、事実上不可能になる恐れがあるという。

一方で、OpenAIの社内関係者からはソーシャルメディア上で異なる見方も示された。監視が難しいAIや透明性低下を招く競争への懸念が出る一方で、Astraの構造を巡る一部の解釈は行き過ぎだとする声もあった。

OpenAIの最高科学者、ヤクブ・パホツキ氏は、Astraの内部計算の深さはGPT-4比で2倍以内の水準だと説明した。その上で、仮に当該技術が使われていたとしても、不透明性が一部で受け止められているほど劇的に増すわけではないと主張した。また、混乱を招く報道が「監視不可能性へ向かう競争」を逆にあおる可能性があるとの懸念も示した。

同氏はさらに、OpenAIが初期の推論モデルの段階からChain of Thoughtモニタリングを維持し、活用してきたと説明した一方、この監視手法自体は脆弱で、最近は否定的な方向に向かっているとも述べた。ただし、その原因が必ずしもアーキテクチャの変更にあるとは限らないとしている。

Astraを巡る議論の焦点は、AIの性能向上と安全監視をどう両立させるかにある。OpenAIはAstraの高いサイバー能力を認識したうえで追加のモニタリングと保護措置を講じているが、研究者の間では、内部推論の可視性が低下すれば現在の安全確認の仕組みそのものが揺らぎかねないとの懸念が残る。Astraの実際の構造と、OpenAIが推論モニタリングをどう維持するのかが今後の焦点となりそうだ。

キーワード

#OpenAI #Astra #人工知能 #AI安全性 #サイバーセキュリティ #Chain of Thought #Chain of Thought モニタリング
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.