写真=ダニエル・シェイ氏とショーン・ロシュ氏(両氏のLinkedInより)

OpenAI出身者が創業したTypeSafe AIの新たなAIモデル「Jev」が、AI業界で注目を集めている。Jevは文章生成ではなく、業務上の判定や意思決定に特化したモデルで、LangChainはAIエージェント評価への応用可能性に着目。精度や判定のばらつき、コスト面を比較した検証結果を公開した。

AIアプリケーション開発フレームワークを手掛けるLangChainのダニエル・シェイ氏(Daniel Shea)とショーン・ロシュ氏(Seán Roche)は、Jevを分析した記事を公表した。両氏は、AIエージェントの評価手法としてJevが持つ可能性に注目している。

TypeSafe AIが「System 1」モデルと位置付けるJevは、既存の大規模言語モデル(LLM)とは性格が大きく異なる。ChatGPTのように文章を生成したり対話したりするのではなく、ソフトウェア内で必要な判断を下すことに主眼を置いたモデルだ。

例えば、顧客からの問い合わせを受けた際に、その内容を「返金案件」と判定する。コールセンターのシステムはその結果を受け取り、返金対応チームにチケットを自動で割り当てられる。返答も長文ではなく、「返金チームへ送付」といった事前定義済みの形式で出力する。

狙いは文章生成能力ではなく、業務プロセスで求められる意思決定を迅速に処理することにある。TypeSafe AIによれば、AIエージェントは毎回LLMを呼び出さなくても、比較的単純な判断をJevに委ねられるという。

これまでAIエージェント評価の手法は、大きく2つに分かれていた。コードベースの評価と、LLMによる判定(LLM-as-a-judge)だ。

LangChainによると、コードベース評価は高速かつ低コストだが、適用範囲が限られる。エージェントがツールを呼び出したかどうかは確認できても、適切な回答だったかを判断するのは難しい。正解が複数あり得る課題では、この制約がより大きくなるという。

一方、LLM-as-a-judgeはこうした隙間を埋められる。質問内容や行動ログ、根拠資料をまとめて読み込んで評価できる半面、結果にばらつきが出やすく、処理速度も遅い。コストも高くなりがちだ。

両氏は、Jevが別のアプローチでこの課題を解決し得るとみている。AIエージェント評価の本質は「文章生成」ではなく「判定」にあり、エージェントの状態や行動を見てスコアを付ける作業だという。Jevはこうした判断タスク向けに最適化されているのに対し、一般的なLLMは単語を順に生成しながら判断を進める構造だと説明している。

LangChainは検証にあたり、自社のエージェントフレームワーク「Deep Agents」を使ってテスト用エージェントを構築した。天気に関する質問5件でデータセットを作成し、同じ実行ログをJev、GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6にそれぞれ100回ずつ評価させた。比較の基準には人手による採点を用いた。

結果は明確だったという。両氏によると、正確性の面ではJevが500回すべてで人手評価と一致した。Terraは99.8%、Lunaは96.4%、Claudeは80%だった。

判定のばらつきもJevが最も小さかった。平均偏差は0.0000149で、Lunaの433分の1、Terraの913分の1、Claudeの92分の1に抑えられた。両氏は、この実験だけでばらつきが小さい理由を断定することはできないとしつつ、定型フォーマットで回答するよう訓練されたモデル構造が影響した可能性があると指摘した。

コストと速度の差も大きい。Jevの平均処理時間は0.44秒で、1件当たりの費用は0.00035ドルだった。一方、同じ作業にかかった費用はClaudeで総額28.17ドル。Jevの総費用は0.34ドルにとどまった。

両氏は、低コスト化によって評価の実施頻度を高め、より広い範囲を対象にできるようになると説明する。1日に1万件ずつ作業ログが蓄積する本番環境のAIエージェントでは、こうしたコスト差が運用そのものを変える可能性があるとしている。

もっとも、両氏はJevの可能性を評価しつつも、慎重な見方を崩していない。コストが低いからといって、それだけで望ましいとは限らないとし、継続的に誤る評価モデルは、誤ったフィードバックを大量に与えることになりかねないと強調した。人手による確認や、評価モデルが人の判断と整合しているかを検証する作業は、引き続き必要だとしている。

今回の検証はあくまで一例であり、別のAIエージェントや実運用環境でも同様の結果が得られるかは見極めが必要だという。

それでも両氏は、Jevの将来性には前向きだ。System 1系モデルによって高品質な評価が広く利用可能になる可能性があるとし、より多くの実行ログがフィードバックへと変わることで、問題発見の早期化や開発速度の向上につながるとの見通しを示した。

キーワード

#TypeSafe AI #Jev #判定特化AI #AIエージェント評価 #LangChain #LLM-as-a-judge #LLM評価
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.