Claude Opus 5とは?価格は同じで伸びた2つの指標
画像出典: Anthropic
Anthropicは2026年7月24日にClaude Opus 5を公開しました。価格は前モデルのOpus 4.8と同じ入力$5・出力$25(百万トークンあたり)のまま、PC操作の自律実行を測るOSWorld 2.0が55.7%から70.6%へ、総合推論のFrontier-Bench v0.1が18.7%から43.3%へ伸びています。伸びが大きいのは「複数手順を最後までやり切る」タイプの作業で、単純な文章生成の速さとは別の軸です。
新モデルの発表で最初に目に入るのはスコアの一覧です。ただ、スコアは「何を測った試験なのか」を知らないまま眺めても、順位以上の意味を持ちません。テストの科目名を見ずに点数だけ比べているような状態です。
Anthropicは2026年7月24日、上位モデルClaude Opus 5を公開しました。Claude.ai、Claude Code、Claude API、Claude Cowork、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundryなどで利用でき、Claude Maxの新しい既定モデル、Claude Proでの最上位モデルという位置づけです。
ここでは数字そのものより先に「その数字が何を測っているか」を順に見ていきます。測っているものが分かれば、自分の仕事に効く進化なのか、関係の薄い進化なのかを自分で判断できるようになります。
Opus 5で何が公開された?
まず事実を揃えておきます。APIのモデルIDは claude-opus-5、コンテキストウィンドウ(一度に読み込める文章量の上限)は1Mトークン、1回の出力は最大128Kトークンまでです。日本語の場合、1トークンはおおむね1文字前後に相当するので、長い資料をまとめて渡す使い方が前提に置かれた設計といえます。
価格は前モデルのOpus 4.8と据え置きです。ここが今回の発表で地味ながら効いてくる点で、同じ費用のまま中身が入れ替わったという形になっています。Anthropicは上位モデルFable 5の半額で、Fable 5に迫る性能だと説明しています。
| モード | 入力 | 出力 | 備考 |
|---|---|---|---|
| 通常モード | $5 | $25 | Opus 4.8と同一価格 |
| Fast モード | $10 | $50 | 通常の2倍の価格で約2.5倍高速化。Opus 5とOpus 4.8のみ対応 |
Anthropicの公表データをもとに作成(Fast モードの価格・仕様は二次情報源 hundredtabs.com による補足)
いずれも百万トークンあたりの金額です。Fast モードは速度と引き換えに単価が2倍になる選択肢で、Sonnet や Haiku といった下位モデルには用意されていません。
ベンチマークは何を測っている?
ここが本題です。よく並ぶ4つの試験は、測っている能力がそれぞれ違います。
- SWE-bench Verified / Pro — 実在のソフトウェアの不具合を修正できるかを測る。コーディング支援の目安になるが、文書作成やリサーチ力とは直接対応しない
- OSWorld 2.0 — PCの画面を自分で操作してタスクを完了できるかを測る。ファイルを開く、アプリを操作するといった自動化の目安
- ARC-AGI-3 — 見たことのないパターンから規則を推論する力を測る。いわゆる「地頭」に近い指標で、定型作業の速さとは別軸
- Frontier-Bench v0.1 — 幅広い分野の難問を横断して解かせる総合推論の試験
科目名が分かったところで、実際の数値を見ます。
| ベンチマーク | Opus 5 | Fable 5 | Opus 4.8 | 出典区分 |
|---|---|---|---|---|
| SWE-bench Verified | 96.0% | 95.0% | 非公開 | 二次情報源(Vellum, DataCamp) |
| SWE-bench Pro | 79.2% | 80.0% | 69.2% | 二次情報源(DataCamp) |
| ARC-AGI-3 | 30.2% | 非公開(次点モデル7.8%) | 1.5% | Opus5/次点モデル値はAnthropic公式、Opus4.8値は二次情報源 |
| OSWorld 2.0 | 70.6% | 66.1% | 55.7% | Opus5とOpus4.8の値はAnthropic公式、Fable5値は二次情報源 |
| Frontier-Bench v0.1 | 43.3% | 33.7% | 18.7% | Opus5とOpus4.8の値はAnthropic公式、Fable5値は二次情報源 |
| GDPval-AA v2 Elo | 1861 | 1747 | 非公開 | 二次情報源(DataCamp) |
DataCampの公表データをもとに作成(一部数値はAnthropic公式発表とも一致)
上の表で目を引くのは、右端の出典区分がすべて同じではないことです。Anthropic公式が明記しているのはFrontier-Bench v0.1、ARC-AGI-3のOpus 5の値、OSWorld 2.0のOpus 5とOpus 4.8の値などで、SWE-bench系やGDPval-AA v2は二次情報源からの引用です。同じ表に並んでいても、数字の確からしさは一様ではありません。
さらに、ベンチマークのスコアは各社が独自に算出条件(サンプル数、与えるプロンプト、ツールの設定)を決めて公表するのが一般的です。条件が揃っていない以上、小数点以下の差を勝ち負けとして読むのは無理があります。上の表のSWE-bench Proのように1ポイントに満たない差は、測定条件の違いで簡単に入れ替わる範囲です。
「◯◯で1位」は、その試験の条件下での話です。実務で効いてくるのは、自分が任せたい作業に近い科目で伸びているかどうか。全科目の平均点を見るより、1科目だけを見たほうが判断に使えます。
どこが実際に伸びたのか?
科目ごとに見ると、伸び幅には偏りがあります。同じ指標で世代を並べると分かりやすいので、伸びが顕著な3つのベンチマークをOpus 4.8からの変化として整理します。
| ベンチマーク | Opus 4.8 | Opus 5 |
|---|---|---|
| OSWorld 2.0 | 55.7% | 70.6% |
| Frontier-Bench v0.1 | 18.7% | 43.3% |
| ARC-AGI-3 | 1.5% | 30.2% |
Anthropicの公表データをもとに作成(ARC-AGI-3のOpus 4.8値のみ二次情報源)
上の3行に共通するのは、いずれも手順が長く、途中で状況が変わる作業を測っている点です。1問1答の正解率ではなく、画面を操作しながら次の一手を決めたり、前提の見えない問題から規則を組み立てたりする力にあたります。
Anthropicは業務自動化の完遂率を測るZapier AutomationBenchでも、次点モデルの約1.5倍のパスレートだったとしています。完遂率とは、途中で止まらず最後まで終わらせた割合のことです。専門分野では、有機化学の分光データから分子構造を推定するタスクでOpus 4.8比+10.2ポイント、タンパク質関連のタスクで+7.7ポイントという社内ベンチマークの結果も公表されています。
文章生成の品質は、この世代交代で最も変化が読み取りにくい部分です。公表されているベンチマークの多くはコーディング・PC操作・抽象推論に寄っており、日常的な文書作成の質を直接測る指標はほとんど含まれていません。実務品質を評価するGDPval-AA v2 Eloで1,861(Fable 5は1,747)という数字はありますが、これは二次情報源からの引用で、Opus 4.8との比較値も公表されていません。
新しく入った機能は何?
スコア以外の変更も、使い勝手に効いてきます。
- 会話途中のツール構成変更に対応作業の途中で「使える道具」を差し替えられるようになりました。従来は会話の最初に渡した構成が固定されていたため、状況に応じてツールを足す場合は会話をやり直す必要がありました。
- 安全分類器によるフォールバック安全分類器(入力や出力に問題がないかを判定する仕組み)が問題を検知すると、自動的に別のモデルへ処理が引き継がれます。
- Fast モードの切り替えコストと速度のどちらを取るかを、利用者側で切り替えられる機能が搭載されたと報じられています。
Anthropicは、Opus 5について「最も安全性が高く(most aligned)、誤用に対する耐性が最も高いOpusモデル」であり、「自分の作業を検証し、慎重に反復する能力が大幅に向上」したと説明しています。この「自分で検証して直す」性質は、長い手順を最後までやり切る力とつながっている部分です。
Fast モードはいつ使う?
単価が2倍になる代わりに約2.5倍速くなる、という交換条件です。速さが体感で効く場面と、効かない場面がはっきり分かれます。
- 向く: 対話しながら詰めていく作業、細かく試して直す反復、その場で動かしながらのデバッグ
- 向かない: まとめて投げて後で結果を見るバッチ処理、急がない非同期タスク、コストを抑えたい定常作業
セッションの途中で通常モードからFast モードへ切り替えると、プロンプトキャッシュ(同じ文脈を再送する際に費用を抑える仕組み)が無効になります。それまでの会話ぶん全体がキャッシュなしの価格で再計算されるため、長い会話の途中で切り替えるとコストが跳ね上がりやすくなります。Fast モードを使うなら、セッションの開始時点で決めておくのが無難です。
結局どう使い分ければいい?
ここまでの内容をまとめると、Opus 5が効くのは「複数の手順があって、途中で判断が必要で、最後までやり切ってほしい作業」です。逆に、決まった形式への整形や短い文章の言い換えのように、手順が1つで判断の余地が小さい作業は、伸びた部分とあまり噛み合いません。
そこから、費用対効果の高い組み方が見えてきます。日本語メディアでは、日常的なテキスト処理やデータ整形は低コストなHaiku・Sonnetなどの小型モデルに任せ、重要な意思決定や成果物の最終検証だけOpus 5を呼び出す「アドバイザー戦略」と呼ばれるハイブリッド運用が提案されています(事業者ブログの見解であり、一次情報ではありません)。
また、Opus 4.8と同じ価格のまま業務完遂系タスクの成績が上がっているため、複数ステップの業務自動化を最後までやり切らせる用途への適性が上がったという見方も出ています。すでにOpus 4.8を使っているなら、費用が変わらない以上、まず同じ作業をそのまま流してみるのが一番確実な評価方法です。
ベンチマークは、モデルの性格を大づかみに知るための地図です。地図が細かくても、実際に歩く道の状態は歩いてみないと分かりません。科目名を知ったうえで自分の作業に近い数字だけを見て、あとは手元で試す。この順番が、新モデルが出るたびに振り回されない一番の方法です。
よくある質問
Claude Opus 5はいつ公開されましたか?
Anthropicは2026年7月24日にClaude Opus 5を発表・公開しました。Claude.ai、Claude Code、Claude API、Claude Cowork、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundryなどで利用でき、Claude Maxの新しい既定モデル、Claude Proでの最上位モデルという位置づけです。
Opus 5はOpus 4.8より高くなりましたか?
通常モードの価格は入力$5・出力$25(百万トークンあたり)で、前モデルのOpus 4.8と同一です。単価を2倍にして約2.5倍高速化するFast モードを選んだ場合のみ、入力$10・出力$50になります。
SWE-benchやOSWorldは何を測っているベンチマークですか?
SWE-bench Verified / Proは実在のソフトウェアの不具合を修正できるかを測る試験で、コーディング支援力の目安になります。OSWorld 2.0はPCの画面を自律的に操作してタスクを完了できるかを測る試験で、画面操作の自動化能力の目安です。どちらも日常的な文書作成やリサーチの力とは直接対応しません。
ベンチマークのスコアをそのまま比較してよいですか?
注意が必要です。スコアは各社が独自にサンプル数・プロンプト・ツール設定などの条件を決めて算出・公表しているため、条件が揃っていないまま横並びにすると誤った印象になります。数ポイント差の順位よりも、自分が任せたい作業に近いベンチマークで世代間の伸びがあるかを見るほうが実用的です。
※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。