いろは堂AI
← 戻る

Claude Opus 5.5が安く速い仕組み、譲る境界線は

2026年9月26日|いろは堂AI編集部
屋内のレンガ壁のカフェ風スペースで、男性1人が木製テーブルでノートパソコンを操作している写真

画像出典: パブリックドメイン(Wikimedia Commons)

この記事の要点
Anthropicは2026年9月22日にClaude Opus 5.5を公開しました。Opus 5比で総合的な運用コストは約40%削減、出力速度は30%以上高速で、Terminal-Bench 4.0では66.4%とOpus 5の52.3%を上回っています。安さの主因は、問題の難易度に応じて内部で考える量を自ら決めるAdaptive Thinkingと、low〜maxのEffort指定にあり、xhigh・maxでも足りない高難度作業はFable 5.1に任せる運用がAnthropicから示されています。
🤔
AIが安くなったのに性能は落ちてないって、どこで削ってるんだろう

値段が下がると、たいてい何かを削っています。ところがClaude Opus 5.5は、Opus 5より総合的な運用コストが約40%安く、出力は30%以上速いのに、主要な評価では数字が上がっています。削られたのは答えの質ではなく、答えを出す前にモデルが内部で「考える」量です。

正直なところ、ここを知らないまま使っても仕事は進みます。ただ、自分の作業のどこにこのモデルを置くか、どこから上位モデルに任せるかは、仕組みがわかると自分で決められます。

Claude Opus 5.5で何が変わった?

Anthropicは2026年9月22日、Claude 5.5ファミリーの最初のモデルとしてClaude Opus 5.5を公開しました。位置づけは「多くの作業でClaude Fable 5.1と同等の性能」で、なおかつOpus 5より大幅に安く速いモデルです。提供はAWS、Google Cloud、Microsoft Azureを含む全プラットフォームで始まっています。

まず、値段の下がり方を実数で見ておきます。

項目Opus 5.5Opus 5
入力トークン(百万あたり)$4$5
出力トークン(百万あたり)$20$25
キャッシュ読み込み(百万あたり)$0.20$0.50

Anthropicの公表データをもとに作成

上の表の単価だけを見ると、入力・出力は2割引きです。ところがAnthropicは総合的な運用コストは約40%削減と説明しています。単価の引き下げ幅より実際の削減幅が大きいのは、1回の応答で使うトークンそのものが減っているからです。ここが今回の本題になります。

性能は本当に「そのまま」なのか?

安くなった話の前に、質が落ちていないかを確かめておきたいところです。Anthropicが公表した評価結果は次のとおりです。

ベンチマークOpus 5.5Fable 5.1Opus 5
Terminal-Bench 4.066.4%55.8%52.3%
FrontierCode v1.154.4%50.3%—
GDPval-AA v2.1 (Elo)18461735—
OSWorld 2.0(部分的成功率)81.8%——

Anthropicの公表データをもとに作成(「—」は比較数値が公表されていない箇所)

上の表のTerminal-Bench 4.0は、ターミナル(黒い画面にコマンドを打って操作する環境)で与えられた作業を最後までやり切れるかを測る評価です。FrontierCode v1.1は、実際の開発現場に近い難度のコーディング課題を解かせる評価。GDPval-AA v2.1は実務タスクの評価で、Elo(対戦成績から相対的な強さを数値化した指標)はOpus 5.5が1846、Fable 5.1が1735です。OSWorld 2.0はAIが人のようにPCを操作する力を測る評価で、部分的な成功率が81.8%。VentureBeatも、主要なエージェントベンチマークでFable 5.1を上回りながらAPI価格は60%安いと報じています。Anthropicは具体例として、68万行のコード移行を1日以内に完了できると説明しています。

安くなったのに数字が上がっている、という珍しい形の更新です。

「考える量を抑える」とはどういうことか?

😟
考える量って、こっちからは見えない部分ですよね

見えないところで起きているので、まず前提をそろえます。いまのモデルは、答えを書き始める前に内部で下書きのような推論を進めます。これがextended thinking(内部の熟考)で、ここで使ったトークンも料金と待ち時間に乗ります。

従来は、この思考にどれだけトークンを使うかを開発者が事前に固定で指定する方式でした。Anthropicは先行するOpus 4.6でこれを廃止し、Adaptive Thinking(モデルが問題の難易度を自分で判断し、思考に使うトークン量を自ら決める仕組み)に置き換えています。Opus 5.5もこの系譜の上にあります。

身近な例に置き換えると、会議で「はい、来週火曜で大丈夫です」と即答すべき質問に対して、10分黙って考え込む人はいません。逆に契約条件の判断なら、黙って読み込む時間が必要です。固定予算方式は、この両方に同じ時間を割り当てていたようなものでした。

コストが下がった二つの理由
  • モデル自体の推論効率が上がった
  • 簡単な質問には短く、難しい質問には長く考えるようになり、無駄な思考トークンが減った

単価の2割引きより実際の削減が大きいのは、この2つ目が効いているからです。

Effortの5段階はどう使い分ける?

Adaptive Thinkingは自動ですが、利用側が触れるつまみもあります。Effort(努力度=思考の深さの上限指定)で、Opus 5.5ではlow / medium / high / xhigh / maxの5段階が選べます。既定はmedium相当で、コスト・速度・精度のバランスを取る設定です。

Anthropicの説明では、Thinkingは常にAdaptiveであり、制御できるのは主にこのEffortレベルです。そして低いEffort設定でも、低遅延が求められる用途では十分な性能を保つとされています。

  1. まず既定のmediumで一度通す自分の実作業をそのまま投げて、出力の質を見ます。ここで足りているなら、調整は不要です。
  2. 速さが欲しい作業はlowへ下げる定型メールの下書き、議事メモの整形、短い要約のように、判断より作業量が主な用途です。待ち時間とコストが下がります。
  3. 質が足りない作業だけhighやxhighへ上げる要件の矛盾を洗い出す、長い資料から判断材料を組み立てるなど、考える手数が要る作業に絞って上げます。全部を上げるとコストと待ち時間が戻ってしまいます。
  4. 上げても足りなければモデルを変える次の章の境界線です。

上げ下げの判断は、出力を見て後から変えられます。最初から最大にせず、既定から始めて足りない作業だけ上げるほうが、結果として安く済みます。

どこから上位モデルに譲るべき?

🤩
安いモデルで全部いけるなら、それが一番いいのに

全部を1つのモデルで済ませる運用は、Anthropic自身が想定していません。示されている目安は明快です。xhighまたはmax effortで評価しても、高度な推論や長時間にわたるエージェント作業で性能が不足する場合は、Claude Fable 5.1に切り替える。これが境界線です。

大事なのは順番で、「難しそうだからFable 5.1」ではなく、「Opus 5.5をxhigh・maxまで上げて試し、それでも足りないならFable 5.1」です。先に安いほうの上限を使い切ってから乗り換える、という判断になります。

自分では選べない「自動の譲渡」もある

もう一種類、利用側の指定とは別に起きる振り分けがあります。サイバーセキュリティに関わる一部のリクエストは、Opus 5.5からOpus 4.8へ自動的に、かつ透過的にルーティングされます。生物学関連の機微なタスクについても、上位モデルや専用の安全対策が適用されたモデルへ戻る挙動が報告されています。

これは性能不足ではなく安全対策側の設計です。Opus 5.5はAnthropicの自動化された行動監査でこれまでで最も高いスコアを記録し、最上位モデルに適用される安全対策も引き続き備えています。リリース前にはFrontier DesignやMETRといった外部評価機関によるテストも実施済みです。なお検証済み組織は、Anthropicの検証プログラムを通じてより広い範囲のアクセスを得られるとされています。

安くなっても向かない使い方があります

単価が下がったからといって、同じ作業に高いEffortを常用すれば費用は増えます。安さの中身は「必要なときだけ長く考える」ことなので、全部をmaxで回す使い方はこの設計と逆向きです。

また、長時間走らせるエージェント作業や高度な推論では、Opus 5.5が上限でも届かない場面があるとAnthropic自身が認めています。手元の作業で出力の質が安定しないと感じたら、Effortの調整より先にモデルの選択を見直すほうが早いことがあります。

Sonnet 5.5とHaiku 5.5は近日公開予定とされていますが、具体的な日付は公表されていません。軽い用途をそちらへ寄せる前提で設計を固めるのは、まだ早い段階です。

今日の自分の作業にどう入れるか

仕組みの話を、手元の作業に落とします。やることは、自分が毎週繰り返している作業を「考える手数」で二つに分けるだけです。

作業の振り分け表を作る
  • 低いEffortで回す: 定型メール、議事メモの整形、決まった形式への書き換え、短い要約
  • 高いEffortを使う: 矛盾の洗い出し、長い資料からの判断材料の組み立て、設計や方針の検討
  • Fable 5.1に回す: 上を xhigh・max で試して質が足りなかったもの

最初の1週間は3つ目の欄が空でも構いません。空欄が埋まったときだけモデルを変える、という記録の取り方が、そのまま費用の最適化になります。

ちなみに今回のリリースは、CEOのダリオ・アモデイがAI開発の減速を呼びかけたあとに公開された最初のモデルだとYahoo Financeが報じています(呼びかけ自体の内容は公表情報での確認が別途必要です)。安く速くする方向の更新が続いていることは、使う側の設計にも影響します。

😌
全部を最強の設定で回さなくていい、と考えると気が楽になりました

モデルが自分で考える量を決めるようになった以上、利用側がやることは「どこまで任せるか」の線を引くことに移ります。既定から始めて、足りない作業だけ上げる。それでも足りなければ譲る。この順番だけ覚えておけば十分です。

よくある質問

Claude Opus 5.5はOpus 5からどれだけ安くなりましたか?

Anthropicの公表値では、入力トークンが百万あたり$5から$4、出力トークンが$25から$20、プロンプトキャッシュ読み込みが$0.50から$0.20に下がりました。総合的な運用コストはOpus 5比で約40%削減、出力速度は30%以上高速化しています。

Adaptive Thinkingとは何ですか?

モデルが問題の難易度を自ら判断し、答えを出す前の内部の推論にどれだけトークンを使うかを自分で決める仕組みです。Anthropicは先行するOpus 4.6でこの方式を導入し、開発者が事前に固定の思考トークン予算を指定する方式を廃止しました。簡単な質問には短く、複雑な問題には長く考えてから答えます。

Effortはどの段階を選べばよいですか?

Opus 5.5ではlow / medium / high / xhigh / maxの5段階が選べ、既定はmedium相当でコスト・速度・精度のバランスを取る設定です。Anthropicは、低いEffort設定でも低遅延が求められる用途では十分な性能を保つと説明しています。既定で試して質が足りない作業だけ段階を上げる使い方が無駄が出にくいです。

Opus 5.5からFable 5.1に切り替える目安はありますか?

Anthropicは、xhighまたはmax effortで評価しても高度な推論や長時間にわたるエージェント作業で性能が不足する場合に、Claude Fable 5.1へ切り替えるという指針を示しています。また、サイバーセキュリティに関わる一部のリクエストは安全対策としてOpus 5.5からOpus 4.8へ自動的にルーティングされます。

※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。