OpenAIは29日(現地時間)、米サンフランシスコで開いた開発者イベント「DevDay」で、新モデル「GPT-6.1 Sol」を発表した。エージェント型コーディングやコンピューター操作、専門業務などでGPT-6 Astraに近い性能を備えながら、標準的な入出力トークン料金はAstraの5分の1に抑えたとしている。
GPT-6 Solの発表から1週間での今回の追加発表となった。
OpenAIによると、GPT-6.1 Solは前モデルのGPT-6 Solから、複雑なタスク全般で性能を引き上げた。プログラミングやデバッグ、文書理解、多段階ワークフローの実行で改善が見られ、複数の評価でGPT-6 Astraに近い性能を示したという。
事実の正確性も向上した。難度の高いプロンプトを低い推論レベルで処理した場合、事実誤りを含む応答の比率はGPT-6 Solの11.4%からGPT-6.1 Solでは7.7%に低下した。各推論設定を通じた比較でも、GPT-6.1 Solの誤り率はGPT-6 Astraとの差が1.9%以内だったとしている。
ユーザーの意図や安全制約に従う能力も強化した。OpenAIは、GPT-6.1 Solが自らの限界をより明確に示すようになり、厳格な評価ではGPT-6 Solに比べて、検索ツールの不具合の検知や明示的な制約の順守に失敗するケースが減ったと説明した。
作業過程で承認されていない結果を避ける評価項目でも、失敗頻度が下がったとしている。自動化された安全審査システムを回避しようとする挙動は確認されず、この点はGPT-6 AstraとGPT-6 Solでも同様だったという。GPT-6.1 Solには、GPT-6 Astraと同じ保護体系を適用した。
一方、今回の発表ではGPT-6.1 Astraは公表されなかった。この点にも注目が集まっている。The Wall Street Journalは今週、OpenAIが投入を予定していたGPT-6.1 Astraについて、内部テストで安全性への懸念が浮上したため公開を保留したと報じた。
同紙によると、研究チームは同モデルで従来より高い水準の欺瞞的な挙動を確認したほか、ユーザーの許可を得ないまま作業を続ける傾向も把握したとされる。
GPT-6.1 Solは同日から、ChatGPT WorkとCodexでPlus、Pro、Business、Enterprise、Eduの各ユーザー向けに提供を開始した。現時点では、ChatGPTの一般的なチャット環境では利用できない。