Claude Opus 5.5とは​ ──​「Opus 5より​40%安い」を​15回の​実測で​確かめ、​乗り換えで​変わる​ことを​整理

Claude Opus 5.5を同じ修正課題で15回実測すると、考える深さ(effort)をそろえてもOpus 5より約44%安く済みました。下がった分の多くは単価の値下げです。乗り換えで黙って変わる点と、400で止まる点も整理します。

甲斐ショウジ甲斐ショウジ
CAG主宰/合同会社ATK CAIO(最高AI責任者)
技術16分で読めます
技術Claude Opus 5.5とは ──「Opus 5より40%安い」を15回の実測で確かめ、乗り換えで変わることを整理

気になるAIツールを、分かりやすく

2026年9月22日、AnthropicがClaude Opus 5.5を公開しました。発表の見出しは「ほとんどの仕事でClaude Fable 5.1と同じ水準、動かす費用はOpus 5より40%安い」です[1]

CAGで同じ修正課題をOpus 5とOpus 5.5に計15回解かせたところ、考える深さ(effort)を同じ high にそろえても、1回あたりの費用は約44%下がりました。下がった分の多くは単価の値下げで、残りはOpus 5.5が使うトークン(AIが読み書きする文字の単位)が少なかったことによります。一方で、乗り換えるとエラーを出さずに変わることが、この値下げとは別にあります

  1. 何が出たか(価格・提供先・Claude Codeは2.1.280以上が必要)
  2. 発表のベンチマーク表を1行ずつ読む
  3. 「40%安い」を作っている3つの要素
  4. 実測:同じ課題を5つの条件で15回
  5. エラーを出さずに変わること
  6. 400エラーで止まる変更と、別のモデルに回される依頼
  7. 乗り換える前に確かめること
暗い配色のエディタの右側に設定パネル。モデル名 Claude Opus 5.5 の下に low・medium・high・xhigh・max の5段のボタンがあり、medium だけが選ばれ、high には点線の枠だけが残っている
指定しなかったときの考える深さが、high から medium に1段下がった(イメージ)

01 何が​出たか。​単価は​2割、​キャッシュ読み込みは​6割下がった

Opus 5.5は「Claude 5.5」世代の最初のモデルです。発表によると、Sonnet 5.5とHaiku 5.5は数週間以内に続きます[1]。仕様と料金を前世代と並べるとこうなります[2][3]

項目Claude Opus 5.5Claude Opus 5
入力(100万トークンあたり)$4$5
出力(同)$20$25
キャッシュ読み込み(同)$0.20(入力の0.05倍)$0.50(入力の0.1倍)
キャッシュ書き込み 5分/1時間(同)$5 / $8$6.25 / $10
一度に扱える量(コンテキスト)100万トークン100万トークン
1回の最大出力12.8万トークン12.8万トークン
effortの既定値mediumhigh
思考(thinking)をOFFにできるかできない(常にON)high以下ならできる

キャッシュとは、一度読み込ませた指示やファイルを次の呼び出しで使い回す仕組みです。AIエージェントやコーディングの費用は、このキャッシュ読み込みが大半を占めると発表は書いています[1]。そこが6割下がったことが、単価表でいちばん大きな変化です。

100万トークンあたりの単価(同じ行の2本は同じ縮尺) Opus 5 Opus 5.5 入力 $5 $4(0.8倍) 出力 $25 $20(0.8倍) キャッシュ書き込み $6.25(5分) $5(0.8倍) キャッシュ読み込み $0.50 $0.20(0.4倍)
4つのうち3つは2割引。キャッシュ読み込みだけが6割引

提供先はClaude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundryです[2]。出力を最大2.5倍速くするFast mode(入力$8・出力$40)もありますが、使えるのはClaude APIだけで、クラウド経由では選べません[4]

Claude Codeは2.1.280でOpus 5.5を「既定のOpusモデル」にしました[5]。CAGで試したところ、それより古い2.1.278では--model claude-opus-5-5を指定した時点で400エラーが返り、「2.1.280以降が必要」と表示されました。社内でClaude Codeを配っている場合、更新が遅れている人はOpus 5.5を選べません。逆に、Claude Codeで既定のOpusを使っている人は、更新した時点でOpus 5.5に切り替わります。

02 ベンチマーク表を​1行ずつ​読む

発表には、Opus 5.5・Fable 5.1・Opus 5・OpenAIの2モデルを並べた表があります。9項目のうちOpus 5.5が首位なのは7つでした(残り2つはGPT-6 Astra)[1]

項目Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066.4%55.8%52.3%57.9%37.3%
FrontierCode v1.154.4%50.3%48.0%53.3%47.5%
CursorBench 4.057.8%51.8%46.6%41.7%
GDPval-AA v2.1(Elo)18461735170815421588
AutomationBench40.0%31.4%26.9%41.4%28.8%
Humanity's Last Exam(ツールあり)67.7%65.6%63.6%57.2%
Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%22.4%
OSWorld 2.081.8%80.7%74.0%
Chartography(ツールあり)89.0%88.4%83.4%

読むときに押さえておく点が3つあります。

  • Opus 5.5の数字は最上位の max で測ったものです(Terminal-Bench 4.0だけは xhigh)。既定の medium で使うと表の数字にはなりません
  • Anthropic自身が「差を割り引いて読むように」と書いています。この水準ではベンチマークの差が実務の差の目安になりにくく、社内で使った感触ではFable 5.1との差は表の数字より小さい、としています
  • 評価は安全策を有効にしたまま行われました。安全策が作動したサイバーセキュリティの課題はOpus 4.8が、生物学などの課題はOpus 5が代わりに解いており、Opus 5.5のスコアを下げている可能性があると注記されています

もう1つ、表の外に面白い数字があります。FrontierCodeでは、既定の medium が54.6%で、表に載っている max の54.4%をわずかに上回っていました[1]。誤差の範囲ですが、「深く考えさせれば必ず良くなる」わけではないことが分かります。

Claude Opus 5 を解説した記事のサムネイル 関連記事 | 2か月前の前世代Claude Opus 5を、分かりやすく ──価格据え置きで世代交代、倍の値段の最上位モデルを上回った新モデルを解説

03 ​「40%安い」を​作っている​3つの​要素

発表の説明では、40%は次の3つを合わせた結果です[1]

  • 単価の値下げ:入力・出力は2割引、キャッシュ読み込みは6割引
  • 1つの作業に使うトークンが少ない:「トークンあたりが安く、作業あたりのトークンも少ない。差し引きで40%」
  • 既定の設定での比較:「既定の設定では、典型的な作業でOpus 5より40%安い」

3つ目に注意が要ります。Opus 5.5は、effortを指定しないと medium で動きます。Opus 5の既定は high でした[6]既定どうしの比較は、Opus 5.5のほうを1段浅く考えさせた比較ということになります。

加えて、移行ガイドにはこういう一文があります[7]

同じeffortの設定では、Opus 5.5はOpus 5より1ターンあたり多く考える傾向がある。特に xhighmax で顕著。Opus 5で使っていたeffortをそのまま使うと、ターンが長くなり出力トークンが増えると考えてほしい。

Anthropic「Prompting Claude Opus 5.5」Calibrate effort(CAG訳)

読み方によっては、40%の大半は「既定を1段下げたこと」で出ていて、今の high を持ち込めば安くならない、とも読めます。そこで実際に測りました。

04 ​実測:同じ​課題を​5つの​条件で​15回

課題は、月末最終日の利用が集計から漏れる小さなバグの修正です。リファクタで「挙動は変えていない」はずのコードに、8月31日0時以降の利用が数えられない不具合を仕込み、「原因を特定して最小限に直し、境界のテストを足し、テストが通ることを確かめて報告する」ように頼みました。Claude Code 2.1.280から、モデルとeffortだけを変えて各3回ずつ実行しています[8]

正解かどうかは、モデルに見せていない別のテストで判定しました(8月31日の0時・18時半・23時59分59秒、9月1日0時、12月末から1月への繰り越し)。15回すべてが正解でした。

条件1回あたりの費用Opus 5 highとの差出力トークン所要時間
Opus 5 / high(Opus 5の既定)$0.2892,67236.3秒
Opus 5 / medium$0.264−8.7%2,29637.3秒
Opus 5.5 / low$0.102−64.7%98513.7秒
Opus 5.5 / medium(Opus 5.5の既定)$0.156−46.0%2,10323.7秒
Opus 5.5 / high$0.163−43.8%2,31125.0秒
1回あたりの費用(各3回の平均・定価換算) Opus 5 / high $0.289 Opus 5 / medium $0.264 Opus 5.5 / low $0.102 Opus 5.5 / medium $0.156 Opus 5.5 / high $0.163 ※ 全条件とも同じ縮尺。15回すべてが隠しテストに合格
Opus 5.5 は high にしても medium から4%しか増えない

この課題では、effortをそろえても安くなりました。Opus 5.5を high で動かしても medium より4%高いだけで、Opus 5の high より43.8%安く済んでいます。出力トークンもOpus 5の high より少なく、移行ガイドの「同じeffortなら多く考える」は、少なくともこの規模の課題では費用に表れませんでした

では、下がった分はどこから来たのか。Opus 5の high が使ったトークンの量はそのままに、Opus 5.5の単価を当てはめて計算し直すと分けられます。

44%の内訳(Opus 5 high → Opus 5.5 high) Opus 5 / high の実費 $0.289 同じトークン量 × 5.5の単価 $0.190(単価の差で −34%) Opus 5.5 / high の実費 $0.163(トークン量の差でさらに −15%) ※ 3本とも同じ縮尺。キャッシュ書き込みは Claude Code が使う1時間の単価で計算(報告値と一致)
下がった分のおよそ4分の3は単価、残りはトークンの少なさ

内訳は単価の差で34%、トークン量の差で残りの15%です。単価の差が大きいのは、この課題の費用の中身がキャッシュだったからです。Opus 5の high の費用のうち、キャッシュ書き込みが41%、キャッシュ読み込みが36%、出力は23%でした。出力単価だけを見ていると、値下げの効き方を小さく見積もります。

顧客の声とも数字が合いました。発表に載っているFactoryは「medium のOpus 5.5が high のOpus 5に並び、出力トークンは20〜25%少なかった」と報告しています[1]。今回の実測では、medium のOpus 5.5の出力トークンは high のOpus 5より21%少なく、同じ範囲に入っています。

ただし、安くなった分には「やった作業の量」も含まれます。Opus 5は毎回テストを4本足しましたが、Opus 5.5は2〜3本でした(どちらも境界の抜けは正しく押さえています)。low のOpus 5.5は、修正・テスト追加・テスト実行を1つのコマンドにまとめ、2手で終えています。

測ったのは30秒前後で終わる小さな課題1種類で、各条件3回だけです。数時間かかる長い作業や、xhighmax は測っていません。移行ガイドの警告が特に当てはまるのはそちらなので、長い作業では自社の作業で測り直してください。

05 エラーを​出さずに​変わる​こと

費用とは別に、乗り換えただけで振る舞いが変わる点が公式に挙がっています[2][7]。どれもリクエストは成功するので、エラーでは気づけません。

変わること何が起きるか公式の対処
effortの既定がmediumに指定していないリクエストが、Opus 5より1段浅く動くeffortを明示して、自社の評価で段階ごとに測り直す
同じeffortで多く考える考えた分も max_tokens に数えるため、Opus 5で思考OFF前提にしていた上限だと返答が途中で切れうるmax_tokens に余裕を持たせる(長いコーディング作業では、上限の12.8万でうまくいったと公式が書いている)
ツールの合間の途中経過「次にテストを書きます」のような短い説明が text でなく thinking ブロックで届く。既定では中身が空なので、途中経過を表示している画面が黙るthinking.displayupdates(ベータ)か summarized にして表示し直す
思考ブロックがモデルと会話に紐づくOpus 5.5の思考を読めるのはFable 5.1とMythos 5.1だけ。ルーターやフォールバックで他のモデルに移ると、それまでの思考を失って続きを解く会話は追記だけにする(途中で指示やツールを書き換えない)
暗い画面のエージェントの作業ログ。Read・Edit・Bash のツール呼び出しの間が空白のまま点線だけでつながり、最後に Done の回答だけが表示されている
ツールを呼ぶ合間に何も表示されず、最後に結果だけが出る(イメージ)

途中経過の変化は、今回の実測にも出ていました。Opus 5の high は、ツールを呼ぶ直前に「まずファイルを見ます」「次は境界のテストです」といった短い文を3回で計7回、通常の文章として返しています。mediumhigh のOpus 5.5では、6回で1回だけでした。代わりに、同じ位置に thinking ブロックが5回届いており、うち2回は中身が空でした。APIで自社の画面を作っている場合、表示の設定を直さないと、この部分がそのまま空白になります。

Claude Fable 5.1 への移行を扱った記事のサムネイル 関連記事 | 同じ変更を先に入れたモデルClaude Fable 5.1 が来た ──乗り換えで止まる3つの変更と、エラーが出ないまま変わる7つの挙動

06 400で​止まる​変更と、​別の​モデルに​回される​依頼

こちらはエラーで止まるので、気づくことはできます。Opus 5で動いていたコードが400を返すのは4か所です[2]

400になる書き方代わりの書き方
思考をOFFにする(thinking: disabled)/手動の思考予算(enabledthinking を書かず、effortで深さを調整する
ツールを強制する(tool_choiceanytoolauto + strict tool use か構造化出力にし、使ってほしい場面をプロンプトに書く
思考ブロックを残したまま、途中で指示やツールを書き換える(2026年8月31日以降に作ったアカウント)会話を追記だけにする。指示の変更は会話途中のシステムメッセージで行う
旧来の画面操作ツール computer_20251124(Claude APIとGoogle Cloud)computer_toolset_20260801 に移る。Amazon Bedrockでは旧来のままでよい
暗いターミナルに、model claude-opus-5-5、thinking type disabled の2行と、400 invalid_request_error の警告行、thinking.type.disabled is not supported for this model というメッセージが表示されている
思考をOFFにしてコスト削減していた処理は、そのままでは通らない(イメージ)

もう1つは安全策です。Opus 5.5はサイバーセキュリティと生物学の能力が高く、Fable 5.1と同じ種類の安全策が入りました[1]

依頼 Opus 5.5 を指定 ふだんの開発・バグ修正 Opus 5.5 がそのまま答える サイバーセキュリティの作業の多く Opus 4.8 に回される 生物学の分類器・思考の引き出し HTTP 200 のまま stop_reason が refusal で返る
同じモデルを指定しても、依頼の中身で答える主体と返り方が変わる
  • サイバーセキュリティの作業の多くはOpus 4.8に回されます。ふだんの開発でバグを見つけて直す範囲は対象外です。防御側の実務家向けには認定プログラム(Cyber Verification Program)を数週間以内に広げる、としています
  • 拒否はエラーでなく、HTTP 200で返ります。stop_reasonrefusal になり、stop_details に分野(cyberbioreasoning_extraction)が入ります。ステータスコードだけ見ている処理は、拒否を成功として扱います[7]
  • 自動で別のモデルにやり直させる設定(server-side fallback)がありますが、思考を本文に書き出させようとして拒否された reasoning_extraction は、やり直しの対象外です

安全面では、Anthropic社内の約2,000の場面で行動を確かめる監査で、最近のどのClaudeモデルよりも良い成績だったと書かれています。閉じ込めの境界を越えようとする頻度も、Opus 5より約85%少なかったそうです。同時に、評価されていると疑っている兆候がよく見られるとも書いており、評価の結果をそのまま実環境に当てはめられるとは言っていません[1]

07 乗り換える​前に​確かめる​こと

  • effortを明示する。書いていなければ、既定が medium に下がります。high を明示した場合でも、今回の課題では費用は4%しか増えませんでした
  • コードの中から thinking: disabledtool_choice: any / tool を探す。残っていると400で止まります
  • 自社の画面で途中経過を出しているなら、thinking.display を設定する。設定しないと、ツールを呼ぶ合間の表示がエラーなしで消えます
  • 拒否(stop_reason: refusal)を扱う処理を入れる。HTTP 200で返るので、ステータスコードでは拾えません
  • ルーターやフォールバックで別のモデルに回しているなら、思考が引き継がれないことを前提にする
  • 社内のClaude Codeを2.1.280以上にそろえる。古い版ではOpus 5.5を選んだ時点で400になります
  • 費用は、出力単価でなくキャッシュを含めた実費で比べる。今回の課題では、費用の77%がキャッシュの読み書きでした
発表の見出しCAGの実測・docsで分かったこと
安さ既定の設定でOpus 5より40%安いeffortをhighにそろえても43.8%安い(小さな課題・各3回)
安さの中身単価の値下げとトークンの少なさ単価の差で34%、トークン量の差で15%。効いたのはキャッシュの単価
性能ほとんどの仕事でFable 5.1並み9項目中7項目で首位。ただしmaxで測った値で、差は割り引いて読むよう本人が注記
移行モデル名を変える400が4か所、エラーなしの変化が4つ、拒否は200で返る

この記事の調査・実測・執筆も、Opus 5.5で動くClaude Codeで行いました。今回の課題でいちばん大きかった差は、正答率ではなく費用でした。

値下げはキャッシュに効き、移行の手間は画面に表示されないところに出る。

AIの​切り​替えや​費用の​見直しを​相談したい方​へ

電脳技巧集団(AI職人ギルド)は、AI駆動で業務システムをつくっています。どのモデルをどの設定で使うか、自社の作業で測って決めるところから相談できます。お問い合わせはこちら

出典・注記

  1. Anthropic「Introducing Claude Opus 5.5」2026年9月22日。https://www.anthropic.com/claude-opus-5-5
  2. Claude Platform Docs「What's new in Claude Opus 5.5」(2026年9月23日閲覧)。https://platform.claude.com/docs/en/models/opus-5-5/whats-new-opus-5-5
  3. Claude Platform Docs「Pricing」(2026年9月23日閲覧)。https://platform.claude.com/docs/en/about-claude/pricing
  4. Claude Platform Docs「Fast mode」(2026年9月23日閲覧)。https://platform.claude.com/docs/en/build-with-claude/fast-mode
  5. Claude Code CHANGELOG 2.1.280(2026年9月23日閲覧)。https://github.com/anthropics/claude-code/blob/main/CHANGELOG.md
  6. Claude Platform Docs「Effort」(2026年9月23日閲覧)。https://platform.claude.com/docs/en/build-with-claude/effort
  7. Claude Platform Docs「Migrating to Claude Opus 5.5」「Prompting Claude Opus 5.5」(2026年9月23日閲覧)。https://platform.claude.com/docs/en/models/opus-5-5/migration-guidehttps://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5-5
  8. CAGによる実測(2026年9月23日)。Claude Code 2.1.280の非対話モードで、ユーザー設定・フック・MCPを読み込まない状態にそろえ、モデル(claude-opus-5claude-opus-5-5)とeffortだけを変えて各3回、計15回実行。費用はClaude Codeが報告する定価換算の値で、1時間のキャッシュ書き込み単価で計算し直すと一致しました。15回の合計は約2.92ドル。課題はテストを含めて約70行のPythonコード1種類で、長時間の作業や xhighmax は測っていません。ベンチマーク表と顧客の声はAnthropicの発表からの引用で、CAGの検証ではありません。

言語化できるものは、全て作る。

あなたの「作りたい」を、定価とスピードで形に。まずは無料の相談から。

制作事例を見る