Foundation Capitalのジャヤ・グプタ氏は、LLMがこれまで単一モデルで担ってきた検索、判断、推論などの機能が分離され、用途ごとに最適なモデルやサービスを組み合わせる方向に業界が向かっているとの見方を示した。推論コストと遅延がAI製品の採算性を左右し、エージェントの普及がその流れを一段と後押しするという。
グプタ氏はX(旧Twitter)への投稿で、この変化を「知能の大分解(Great Unbundling of Intelligence)」と表現した。
同氏によると、この3年間でLLMは文書抽出、検索、ランキング、異常検知、ツール選択、Web閲覧、回答生成、検証、高度な推論まで幅広い役割を1つのモデルで処理してきた。だが現在は、その『ひとまとめ』の構造が崩れ始めているという。
背景には、必要な能力ごとに求められる計算資源が大きく異なり、適したモデルも違うという事情がある。性能、遅延、コストの差が広がるほど、より経済合理性の高い構成へと移行しやすくなると同氏はみている。
とりわけ重要なのがエージェントだ。エージェントは、人が与えた1つの目標を数百、数千単位の機械的な判断に分解して処理する。このため、各段階で生じるわずかなコスト差や遅延差でも積み重なれば大きくなり、最終的に製品の採算性を大きく左右する。
グプタ氏は、推論コストはすでに実質的な原価になっていると指摘する。小型モデルやオープンウェイトモデルは、日常的な業務を任せられる水準に達した。加えて、検索、メモリ、コンピュータ操作といった機能はLLM本体から切り離され、それぞれ独立したサービスとして提供され始めている。評価手法も改善が進み、低コストのシステムで十分かどうかを見極めやすくなったという。
また、フロンティアモデルの性能が高まるほど、こうしたアンバンドルはユーザーにとってリスク管理の手段にもなり得るという。安価なモデルで処理できない難題だけを最上位のフロンティアモデルに回せばよいからだ。
同氏は、今後の基本形は「最初からフロンティアモデルを使い、後からコストを削る」やり方ではなく、「まずは低コストのモデルで処理し、詰まった部分だけをフロンティアモデルに振り分ける」形に移るとみている。
具体例として挙げたのが、TypeSafeが開発した「Jev(ジェブ)」だ。グプタ氏はJevを、判断機能を切り出した専用モデルの一例と位置付ける。複雑な状況や限定的な質問、選択肢のある回答リストを入力すると、文章ではなく意思決定と確率を返すという。
同氏は「ソフトウェアに必要なのは、緊急かどうか、続行か停止か、許可かブロックかといった判断だ」と説明する。現在は言語モデルがいったん文章を生成し、その文章を再び判断に変換しているが、エージェント内部で繰り返される処理の多くは、そもそも文章生成を必要としないとの見方を示した。
こうした流れは、LLM企業の収益構造にも影響を及ぼしかねない。例えばAnthropicのようなフロンティアモデル企業は、比較的容易なタスクでも高単価で処理することで高い収益を得られる。だが、そうした作業を低コストでこなすプレーヤーが増えれば、利幅は縮小しやすくなる。
グプタ氏は、緊急度の判断はJevのような判断専用モデルが1セント未満で処理し、ランキングはリランカーが担い、検索は検索企業、一般的な文章生成は低価格のモデルに任せればよいと指摘した。その場合、AIアプリ企業はAnthropicと正面から競争する必要がなくなるという。
同氏はこの状況を、フロンティア推論における「逆選択」と表現する。ルーティングが高度化するほど、安価で予測しやすい大量の処理は外部に切り出され、曖昧で長い推論を要する難題だけがフロンティアモデル側に残る構図になるという。
さらに、判断コストが1セント未満、判断時間が数百ミリ秒の水準まで下がれば、新しい製品設計も可能になるとみる。AIエージェントが行動するたびに、その結果を検査する判断モデルを付けられるようになり、Webブラウザー操作や音声対話のように応答速度が重視される領域にも判断機能を組み込めるためだ。
グプタ氏は「相談、検索、取引、保険請求、契約条項について、1%のサンプル検査ではなく100%を評価できる。常時監視と継続的な品質管理が可能になる」と述べた。
そのうえで同氏は、「ここ数年、業界は単一モデルにどれだけ多くの機能を詰め込めるかを競ってきた。だが今後10年は逆に、機能を1つずつ切り離し、アプリケーション側で必要に応じて再構成する時代になる可能性がある」と強調した。