低価格のAIモデルが、実運用でも必ずしも割安とは限らない――。スタンフォード大学などの研究チームが最先端AIモデル8種類を対象に6800件超のタスクを検証した結果、全体の32%で低価格モデルの総コストが高価格モデルを上回った。
Gigazineが米国時間6日に報じたところによると、調査を行ったのはスタンフォード大学、カーネギーメロン大学、カリフォルニア大学バークレー校、Microsoft Researchの研究チーム。数学、プログラミング、科学など複数分野のタスクで、低価格モデルと高価格モデルのコスト構造を比較した。
研究チームは、表面的なトークン単価やAPI利用料だけでは、実際の支出を把握しにくいと指摘する。同じタスクでも、完了までに必要な推論回数や実行ステップがモデルごとに大きく異なるためだ。
例として挙げたのが、YouTube動画をフレーム単位で解析するタスクだ。高価格モデルのGemini 3.1 Proは85ステップで完了した一方、低価格モデルのGemini 3 Flashは1000ステップを超えても完了に至らなかった。このタスクのコストは、Gemini 3.1 Proが1ドル(約150円)、Gemini 3 Flashが14ドル(約2100円)だった。
研究チームは、こうしたコスト逆転の背景として、AIの「過度な思考」と「過度な行動」を挙げた。複雑なタスクでは推論と実行の段階が膨らみやすく、高性能モデルの方が結果として速く、低コストで処理を終える場合があるという。複数分野のテストでは、Gemini 3 Flashが思考トークンを6万超消費した一方、より高性能なGPT-5.4は25トークンで解決した事例も確認された。
コスト予測の難しさも浮き彫りになった。同じ指示を同じモデルに繰り返し入力したところ、試行ごとのコスト差が最大9.7倍に開いたケースもあった。モデル選定だけでなく、同一モデルを反復利用する場合でも支出の変動が大きいことを示している。
こうした結果を踏まえ、企業のAI導入では単純な単価比較から脱却する必要があると研究チームはみている。単純な業務では低価格モデルが有利になり得る一方、複雑な業務では総コストがかえって膨らむ可能性があるためだ。実験を担当したリンジャオ・チェンは「価格だけを見て、どのモデルが安いか判断すべきではない」と述べた。
今回の研究は、AIサービスの料金表がそのまま実運用コストを示すわけではないことを改めて示した。複数段階の推論やツール利用を伴うタスクでは、モデル性能の差が総コストに直結し得る。研究チームは、AIを導入する企業に対し、入力単価だけでなく、タスク完遂率、ステップ数、反復実行時のばらつきもあわせて点検する必要があるとしている。