写真=ChatGPT

AIモデル公開後の性能変動を長期的に追跡するオープンソースのベンチマーク「livenerf」が公開された。米Gigazineが10月1日に紹介した。

livenerfは、同じモデル名でも、サービス運用の過程で推論設定やルーティングが変更され、性能や出力特性が変わり得る点に着目した取り組みだ。過去にはGPT-4でも、時期の異なるバージョン間で数学やコーディングなど一部評価結果が大きく変動したとする研究報告が出ている。

Anthropicでも品質低下の事例が報告されている。Anthropicは4月、Claude Code、Claude Agent SDK、Claude Co-workで発生した品質問題を調査した結果、3月4日に変更した推論強度や別のソフトウェア上の問題が影響したと発表した。一方で、APIとデフォルトの推論システム自体には影響がなかったと説明している。

livenerfは、こうした変化を利用者の印象ではなく、反復測定のデータで捉えることを目的として開発された。開発したのはノースカロライナ大学グリーンズボロ校の学生、ネイサン・ラングリー氏。英国AI安全研究所のオープンソース評価フレームワーク「Inspect」を基盤に構築したという。

現在の測定対象は、先月22日に公開されたClaude Opus 5.5だ。事前評価では2336問を反復テストし、常に同じ結果になる設問を除外した上で、結果が変動しやすい78問を追跡対象に選んだ。最初の10日間の平均値をベースラインとし、その後の2つの10日間区間との変化を比較する。

もっとも、この実験で測定しているのは、Claude Code経由で提供されるサブスクリプション型のOpus 5.5であり、APIモデル全体の性能を代表するものではない。livenerfの開発者も「現時点のデータだけで性能低下を判断することはできない。実際の変化と、利用者の期待値上昇による体感差を切り分けることが、この実験の核心だ」としている。

キーワード

#AI #ベンチマーク #オープンソース #Claude #Anthropic #GPT-4
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.