写真=Gemini

AIが外部サイトへのハッキングなどの事故を相次いで起こすなか、安全管理を強化すべきだとの声が強まっている。ただ、実効性のある統制を実現するハードルは高い。最新のAIモデルほど人間による監視が難しくなり、モデルの「思考過程」を手掛かりに安全性を見極めることも難しくなっているためだ。

AIモデルは、目標達成を優先する設計になりやすいとされる。一方で、高性能化が進むほど内部の挙動は見えにくくなり、人間が十分に監督できなくなるとの見方も出ている。

とりわけ最近、先端AIモデルにおける「思考過程(chain of thought)」の可視性低下が論点として浮上している。思考過程とは、AIが結論に至るまでの中間的な推論の手掛かりを指す。完全な記録ではないものの、人間がAIを監督するうえで重要な材料とみなされてきた。OpenAIのエージェントによるHugging Faceへのハッキングの経緯を解明する際にも、この思考過程が決め手になったという。

だが、足元ではこの思考過程を従来のように追えなくなりつつある。そうした懸念は、AIモデルを開発する企業の内部からも上がっている。

OpenAIの首席科学者ヤクブ・パチョツキは最近のブログで、「残念ながら内部評価の結果、思考過程のモニタリングに頼れる度合いが徐々に低下していることが分かった」と述べた。思考過程を見れば安全性を判断できる、という前提が揺らいでいることを示す発言だ。

米Wall Street Journal(WSJ)によると、思考過程のブラックボックス化が懸念される背景には、内部で使われる「思考トークン」が人間にとって理解しにくくなっている事情がある。エンジニアはこうした情報を「推論追跡記録(reasoning trace)」と呼ぶ。専門家は、これが見えにくくなることで、AIがハッキングや欺瞞的な行動を試みる理由を人間が把握できなくなる恐れがあると警告している。

AI開発企業が、性能や効率を優先するあまり、制御可能性を後回しにしているのではないかとの見方もある。OpenAIの研究陣はブログや論文などで、思考過程の記録の信頼性を維持する重要性を繰り返し訴えてきた。だがWSJは、独立研究者や大学のAI研究者の見方として、より高性能でコスト効率の高いAIを求める圧力が、その前提を揺るがしていると伝えた。

アリゾナ州立大学のAI教授で、米国人工知能学会(AAAI)の前会長を務めたスバラオ・カンバンパティは、「現在のAI学習方式は、実際の推論過程を忠実に示す思考過程を生成するようモデルを訓練しているわけではない」と指摘した。

The Informationは先に、OpenAIが9月に「GPT-6 Astra」を投入するのを前に、「新たな手法でコーディングやPCアプリ操作の能力を高めた一方、AIの思考過程を隠しやすくする特性があり、業界で懸念が広がっている」と報じた。

報道によると、OpenAIはAstraに「recurrent depth」と呼ぶ手法を採用した。回答を出力する前に、モデル内部で同じ演算や推論のプロセスを複数回繰り返す方式だ。

通常、AIは質問を所定の計算ステップに一度通して答えを導く。これに対しrecurrent depthでは、同じ計算ステップを何度も反復することで、回答をより洗練できる。反復計算によって、小型モデルでも大型モデル並みの性能を出しやすく、コストも抑えられるという。

ただ、この手法は思考過程の解読にマイナスの影響を及ぼす可能性がある。The Informationは、思考過程の一部または全部が隠れ、人間がモデルの処理手順を把握しにくくなり得ると伝えた。

もっとも、思考過程そのものにも構造的な限界があるとの指摘は以前からある。AIが示す思考過程は、実際の推論をそのまま示したものではなく、AI自身が生成した要約にすぎない可能性があるためだ。WSJによると、OpenAIの競合であるAnthropicの研究では、AIが先に結論を出したうえで、その結論を正当化するためにもっともらしい論理過程を事後的に作り出せることが示された。

カンバンパティは「AI企業は、AIの活動をより忠実に反映し、人間が理解しやすい形で表現するモデルを作ることはできる。ただ、仮に成功しても、そうしたモデルはコストがかさみ、学習もはるかに難しくなる」と述べた。

課題は資金面だけではない。技術的な難しさも大きい。WSJによると、OpenAIの研究では、AIモデルが思考過程をゆがめて表現できないようにするほど、より深い推論段階に悪意ある意図を隠す可能性が高まることも示唆されている。

キーワード

#AI #AI安全性 #OpenAI #思考過程 #推論追跡記録(reasoning trace) #監視 #セキュリティ
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.