画像=Anthropic

Anthropicは22日(現地時間)、新たなAIモデル「Claude Opus 5.5」を公開した。多くのタスクで上位モデル「Claude Fable 5.1」に近い性能を確保しながら、一般的なワークロードのコストを前世代の「Claude Opus 5」と比べて40%削減したという。出力速度も30%以上向上させた。

「Claude Opus 5.5」は、新シリーズ「Claude 5.5」の第1弾となる。ダリオ・アモデイCEOが12日に、AI開発のペース調整を訴えるエッセーを公表して以降、初の新モデル投入でもある。

同モデルは同日から、ClaudeのPro、Max、Team、Enterpriseの各プランで利用できる。Anthropicはあわせて、Pro、Max、Teamおよびシート制のEnterpriseで、5時間単位の利用上限を引き上げた。サブスクリプション利用者向けには、任意のタイミングで利用上限をリセットできる機能も追加した。

開発者向けには、モデル名「claude-opus-5-5」で提供する。Claude APIに加え、Amazon Bedrock、Google Cloud、Microsoft Foundryでも同日から利用可能となった。GitHubも、有料版のGitHub Copilot利用者を対象に段階的な展開を始めた。Anthropicは今後数週間以内に、中小型モデル「Claude Sonnet 5.5」と「Claude Haiku 5.5」も投入する予定だ。

API価格も見直した。入力は100万トークン当たり4ドル、出力は100万トークン当たり20ドルで、「Opus 5」から20%引き下げた。エージェント型タスクやコーディングでコスト比重の大きいキャッシュ読み取りは、100万トークン当たり0.2ドルとし、60%引き下げた。利用トークン数の減少分も踏まえると、標準設定における一般的なワークロードの費用は「Opus 5」比で40%下がるとしている。

高速処理向けの「Fast Mode」も用意した。Anthropicによると、最大で2.5倍高速に動作し、料金は入力が100万トークン当たり8ドル、出力が100万トークン当たり40ドルとなる。

開発者向けの設定も変更した。「Opus 5.5」ではthinkingを無効化できず、推論の深さはeffortパラメータで調整する方式に改めた。effortのデフォルト値は、「Opus 5」のhighからmediumへ引き下げた。

性能面では、エージェント型コーディング、コンピューター操作、知識労働の分野で首位だった。ベンチマーク「Terminal-Bench 4.0」では66.4%を記録し、「Fable 5.1」の55.8%、OpenAIの「GPT-6 Astra」の57.9%を上回った。一方で、科学研究や業務ワークフローの一部指標では「GPT-6 Astra」を下回った。Anthropicは、社内利用ベースでは「Fable 5.1」との差はスコアほど大きくなかったとしている。

初期の利用事例も公表した。あるテスターは、68万行規模のコード移行を1日足らずで完了したという。社内テストでは、ロードバランサー「HAProxy」をC言語からRustへ移行する作業を、「Fable 5.1」より短い9.5時間で終え、コストも51%低かった。Anthropicは、重要情報を文頭に置き、専門用語や独特な表現を抑えることで、文章の読みやすさも改善したと説明している。

安全性評価では、外部機関のテスト結果と自社判断のいずれでも、「次の能力」の基準は超えていないと結論づけた。米国のMETRは、AI研究開発の自動化能力について、「Fable 5.1」からの改善は小幅にとどまり、AI研究開発を完全に自動化できる可能性は低いと評価した。Anthropicも、責任あるスケーリング方針の観点から、同基準のしきい値を超えていないと判断した。

一方で、AI研究そのものを完全自動化できる、より強力なモデルには、さらに高い安全基準が必要だとの認識も示した。現行の対策だけではその基準を満たせない可能性があるともしている。こうした判断を踏まえ、「Opus 5.5」には「Fable 5.1」と同水準の安全対策を適用した。

サイバーセキュリティ分野では、自ら生成したコードのバグを見つけて修正できる一方、そのほか多くの作業では自動的に「Claude Opus 4.8」へ切り替わるという。生物学分野にも、「Fable 5.1」と同様の安全対策を適用した。あわせて、審査を通過した組織向けに「サイバー検証プログラム」を拡大し、新たに「生命科学検証プログラム」を設ける方針も明らかにした。

約2000のシナリオに基づく自動行動監査では、直近のClaudeモデルを総じて上回る結果だった。封鎖境界を越えようとする傾向を測る新たな評価では、境界回避の試行が「Opus 5」と「Mythos 5.1」より約85%少なかった。

ただ、安全対策を外した評価では、サンドボックス脱出や改ざんを試みた事例が1.5%確認された。ユーザーがプロンプトに貼り付けた悪意ある指示文に従いやすくなる後退も見られたという。Anthropicは、破局的被害リスクの評価については、8月の報告書と同じく「低い」を維持した。

キーワード

#Anthropic #Claude #AI #生成AI #API #Amazon Bedrock #Google Cloud #Microsoft Foundry #GitHub Copilot
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.