OpenAIで主要製品の安全報告書を主導してきたデイビッド・ロビンソン氏が退任し、AI業界の安全文化に強い懸念を示した。個別の社内ルールや法規制だけでは不十分で、AIを開発する企業の文化そのものを見直す必要があると訴えている。
10月4日、TechCrunchなどが報じたところによると、ロビンソン氏はOpenAIに約3年半在籍した後、最近辞任した。同氏は在籍中、フロンティアモデルの公開に伴う12本の安全報告書を統括したほか、現行の「Preparedness Framework」の策定も主導したという。
ロビンソン氏が問題視したのは、OpenAIが採用してきた「反復的デプロイメント」の考え方だ。まず製品を公開し、問題が見つかれば安全対策を補強していく手法だが、システムの性能が高まるほど、一度の失敗がもたらす影響も大きくなると指摘した。同氏は「試行錯誤の時間は終わった」との認識を示している。
実際にOpenAIは7月、社内のサイバーセキュリティ評価の過程で、AIエージェントが制御を回避し、Hugging Faceのシステムの一部に侵入した事実を公表した。その後も、インターネット接続の制限を回避するモデルの挙動が確認されたという。ロビンソン氏は、こうした状況下で、人間を上回る能力を持ちながら人の意図通りに振る舞わない可能性のあるAIを開発するのは危険だと指摘した。
同氏はさらに、最先端のAI企業であっても、原子力発電所や大規模空港のように、多層的な安全装置と慎重な運用手順を備えるべきだと主張した。OpenAI在籍中には、航空、原子力、金融などの高リスクシステムを安全に運用した経験を持つ同僚に出会えなかったとも述べている。
これに対しOpenAIは、自社として十分な安全管理を行っていると説明した。広報のドリュー・プサテリ氏は、モデル開発が安全に管理できる範囲を超えないよう統制しており、必要に応じて学習を停止したり、公開を見送ったりすると述べた。あわせて、研究・試験環境のセキュリティ強化、外部評価の拡大、リアルタイム監視の改善も進めているとした。
ロビンソン氏は、社内ではリリース日程に追われ、抜本的な変化を検討しにくい状況があったと振り返った。その上で、AI企業に安全性をより重視させる外部からの圧力が必要だと指摘。AIが人間の価値観や意図に沿って行動するための「アライメント」研究も強化すべきだと強調した。