Claude Opus 5を、​分かりやすく​ ──価格据え​置きで​世代交代、​倍の​値段の​最上位モデルを​上回った​新モデルを​解説

Claude Opus 5は価格が前世代と同じまま、公表されたベンチマークの大半で倍の値段の最上位モデルを上回りました。何が変わったのか、effortの使い分け、思考が既定ONになったことによる移行時の注意点、プロンプトから消すべき指示までを公式情報だけで整理します。

甲斐ショウジ甲斐ショウジ
CAG主宰/合同会社ATK CAIO(最高AI責任者)
技術15分で読めます
技術Claude Opus 5を、分かりやすく ──価格据え置きで世代交代、倍の値段の最上位モデルを上回った新モデルを解説

2026年7月24日、AnthropicがClaude Opus 5を公開しました[1]前世代のOpus 4.8と価格は同じ(100万トークンあたり入力5ドル・出力25ドル)のまま、公表された評価の大半で、倍の値段の最上位モデルClaude Fable 5を上回っています。

ただ、この記事で本当にお伝えしたいのは順位表の話ではありません。財布に効くのは「AIにどれくらい深く考えさせるか」を処理ごとに選び分ける運用が、やっと現実的になったことのほうです。この設定(effort)は前の世代にもありましたが、下げると質が落ちるので結局いちばん上で回す、という使われ方をしていました。Opus 5は低い段の品質が上がり、公式が「積極的に下げて使ってよい」と書くようになりました[5]

この記事で分かること——①何が出たのか(価格とスペックの事実整理) ②値段が変わらないのに何が良くなったのか ③「考える深さ」のツマミの使い方と落とし穴 ④既存のシステムを移すときにつまずく2点 ⑤プロンプトから消したほうがいい指示 ⑥安全面と、使う前のチェックリスト。数値はすべてAnthropicの公式発表・公式ドキュメントに基づくもので、CAG自身が検証したものではありません(出典は脚注)。

ダークなAPIコンソール画面。モデル選択欄でclaude-opus-5が選ばれ、その下にclaude-opus-4-8が並び、右側に低から最大までの段階スライダー、下部に単価表示が出ている
モデル名を差し替えても、単価の行は変わらない。変わったのは、その隣のツマミの使いどころ。

01 何が​出たのか

Claude Opus 5は、Anthropicが「複雑なエージェント型のコーディングと企業業務向け」と位置づけるモデルです[4]。2026年7月24日に公開され、その日からClaude API・Amazon Bedrock・Google Cloud・Microsoft Foundryのすべてで使えます。

エージェント型(agentic)とは、AIが1問1答で終わらず、ツールを何度も呼びながら自分で手順を進めていく使い方のことです。

項目Claude Opus 5前世代(Opus 4.8)
モデルIDclaude-opus-5claude-opus-4-8
価格(100万トークン)入力 $5 / 出力 $25入力 $5 / 出力 $25
文脈の長さ100万トークン(既定かつ上限)100万トークン
最大出力12.8万トークン12.8万トークン
知識のカットオフ2026年5月2026年1月
思考(thinking)既定でON既定でOFF
深さの段階(effort)low / medium / high / xhigh / max
低い段の品質が向上
low / medium / high / xhigh / max
高速モードClaude APIのみ・約2.5倍速
基本料金の2倍($10 / $50)
あり

まず見てほしいのは価格の行が据え置きだということです。世代が上がれば値上がりするのが当たり前だったところに、同じ値段のまま差し替えられるモデルが来ました。

地味ですが効くのが知識のカットオフが2026年5月まで伸びたことです[4]。ライブラリの仕様変更やAPIの更新を、モデルが最初から知っている確率が上がります。前世代は2026年1月まででした。

個人向けのプランにも反映されていて、Claude Maxの既定モデルがOpus 5になり、Claude Proでも最上位のモデルとして提供されています[1]

02 値段が​変わらないのに、​何が​良くなったのか

公式が挙げているのは5つの評価です。数字そのものより、「何と比べたか」を押さえると意味が分かります。

評価(測っているもの)公式の記述比較相手
Frontier-Bench v0.1
(ソフトウェア開発)
他の全モデルを上回る。Opus 4.8の2倍超のスコアを、より安いタスク単価で全モデル
/ Opus 4.8
ARC-AGI 3
(未知の問題を解く)
2位のモデルの3倍のスコア次点モデル
Zapier AutomationBench
(業務タスクの完遂)
同じタスク単価で合格率が約1.5倍。最低effortでも他のどのモデルより多く合格次点モデル
OSWorld 2.0
(PC操作)
Fable 5の最高記録を、その3分の1強のコストで上回るFable 5
CursorBench 3.2
(コーディング)
max設定でFable 5の最高スコアと0.5%差・タスク単価は半分Fable 5
公表された5つの評価で、どちらが上だったか 出典=Anthropic公式発表(自社によるベンチマーク。第三者の再現ではない) Claude Opus 5 $5 / $25 Claude Fable 5 $10 / $50(倍の値段) Frontier-Bench v0.1 ソフトウェア開発 首位 ARC-AGI 3 未知の問題を解く 首位(2位の3倍) Zapier AutomationBench 業務タスクの完遂 首位(約1.5倍) OSWorld 2.0 PC操作 首位(コストは1/3強) CursorBench 3.2 コーディング −0.5% 首位(差は0.5%)
首位でないのは5件のうち1件、しかも差は0.5%。「最上位に近づいた」という公式のコピーより、公式が出したベンチマークのほうが強い。

ここで何度も出てくるClaude Fable 5は、Anthropicの最上位モデルです(100万トークンあたり入力10ドル・出力50ドル)。Opus 5はその半額にあたります。

Claude Fable 5 解説記事のサムネイル 関連記事 | 比較相手になっている最上位モデルClaude Fable 5 が来た ──"Opusの上"の新クラス、開発者は何を知るべきか

並べてみると気づくことがあります。「最上位に近づいた」どころではありません。公表された5件のうち、Opus 5が首位でないのはCursorBench 3.2の1件だけで、その差も0.5%。残りは最上位モデルを含む他の全モデルを上回っています。OSWorld 2.0にいたっては「Fable 5の最高記録を、その3分の1強のコストで上回った」と明記されています。Anthropic自身も、コーディングと知識労働の評価については「Opus 5が新しいstate-of-the-art(最高水準)」と書いています[1]

ところが公式発表の見出しの言い回しは「Fable 5のフロンティア知能に半額で近づいた」であり、モデル選択のガイドも「最高の能力が要るワークロードにはFable 5を」のまま据え置かれています[4]。出したベンチマークのほうが、自社のコピーより強い。この控えめさには理由が読み取れます。①サイバーセキュリティのタスクでは限定提供のMythos 5に及ばないと明記していること ②CursorBenchの0.5%差はmax設定時の話で、設定次第で順位は動くこと ③半額の製品が最上位を追い越したと言い切ると、上位モデルの位置づけが崩れること。

科学分野でも前世代を上回っています。分光データから分子構造を推定する有機化学のタスクで社内ベンチマーク10.2ポイント増、タンパク質の配列変化が機能に与える影響の予測で7.7ポイント増と報告されています[1]

導入企業のコメントも公式に載っていますが、いずれも各社の自己申告です。Zapierは「以前のモデルは合格しなかったが、Opus 5は100%だった」、Boxは「Opus 4.8比で全体8%向上、データ分析11%、デューデリジェンス17%」と報告しています[1]。読む側の実務としては、順位表の1行を信じるより同じ値段のまま置き換えて、自社のタスクで測り直すほうが早いはずです。

03 ​「考える​深さ」の​ツマミが、​やっと​実用に​なった

effort(エフォート)は、AIが答えを出すまでにどれくらいトークン(=処理の量。そのままコストと待ち時間になります)を使うかの設定で、low / medium / high / xhigh / max の5段階あります[5]

誤解されやすいので先に書いておくと、このツマミ自体はOpus 5で新しくなったものではありません。Opus 4.8にも同じ5段階がありました。変わったのは中身のほうです。

公式ドキュメントはOpus 5について、「lowとmediumは、はるかに少ないトークンと待ち時間で高い品質を出し、以前のOpusの同じ設定を上回る」と書き、そのうえで「評価で品質が保てる範囲なら、コストと応答時間の主要な制御手段として惜しみなく使ってよい」と勧めています[5]。前の世代では「下げると質が落ちるから、結局いちばん上で回す」になりがちだった設定が、実際に下げられるようになった、という話です。

effort=AIが使うトークン量のツマミ(5段階) 棒の高さはトークン量と待ち時間のイメージ(模式図・実測値ではない) low medium high xhigh max 大量の定型処理 日常の判断業務 既定値 推奨の出発点 難問だけ Opus 5で品質が上がったのはこの2段
下げる余地が増えたことが、この世代でいちばん請求額に効く。上げる話より、下げても保つ話。

使い分けの目安(公式の推奨に沿ったもの)

  • 大量に回す定型処理(分類・要約・抽出)→ low / medium
  • 知的な判断が要る通常業務 → high(Claude APIとClaude Codeの既定値。パラメータを省略したのと同じ)
  • コーディング、長時間のエージェント作業 → xhigh推奨の出発点
  • 青天井でいいから最高の結果が欲しい難問 → max

前のモデルからeffortの設定をそのまま持ち越しているなら、自社の評価データで一度振り直すことが公式に推奨されています[5]。ここはそのまま請求額に効きます。

運用で踏みやすい落とし穴も2つあります。

① effortは「回答の長さ」の制御ではありません。 effortが決めるのは考える量であって、Opus 5ではeffortを下げても表示される回答は確実には短くなりません[5]。長さを短くしたいならプロンプトで指示します(05章)。

② 会話の途中でeffortを変えるとプロンプトキャッシュが効かなくなります。 effortの値はプロンプトの組み立て方そのものを変えるため、途中で変更すると前のターンまでのキャッシュが使えなくなります[5]。長いセッションでキャッシュを効かせたいなら最初に決めて固定する。振り分けるのは会話の中ではなく、ワークロード単位で。

なお xhighmax で走らせるときは、max_tokens(出力の上限)を大きめに取ります。公式は6万4千トークンから始めて調整することを勧めています[5]

04 移行でつまずく​2点

既存のシステムをOpus 4.8から差し替えるとき、コードを変えないままだと動きが変わる/エラーになる箇所が2つあります[2]

① thinking(思考)が既定でONになりました。 Opus 4.8では thinking: {"type": "adaptive"} を指定しない限り思考なしで動いていました。Opus 5では同じリクエストが思考ありで動きます。モデルがターンごとに考える量を自分で決め、その深さをeffortで制御する形になりました。

ここで注意が要るのが max_tokens です。max_tokens は「思考+回答テキスト」の合計に対する上限なので、思考なし前提で小さく設定していたワークロードは、上限に引っかかって答えが途中で切れます。移行時に見直してください。

xhigh / max では思考を切れません(400エラー)。 thinking: {"type": "disabled"} が受け付けられるのは、effortが high 以下のときだけです。xhighmax と組み合わせると400エラーが返ります。これはOpus 4.8からの破壊的変更で、Opus 4.8では思考の無効化とeffortは独立していました。

どの組み合わせが通るか Claude Opus 5:思考を切れるのは high 以下のときだけ low medium high xhigh max 思考 ON(既定) =何も指定しない OK OK OK OK OK 思考 OFF thinking: disabled OK OK OK 400 400 この2つだけエラーで弾かれる(Opus 4.8からの破壊的変更)
組み合わせの表を1枚持っておけば、移行時の事故は防げる。迷ったら思考は切らない。
ダークなターミナル画面。リクエストにthinking disabledとeffort maxが同時に指定され、応答としてステータス400のエラーJSONが返っている
切りたい設定と、上げたい設定を同時に出すと弾かれる。移行作業で最初に踏むのがここ。

対処は2つに1つです。思考を切ったままにするならeffortを high 以下に下げる、effortを保つなら thinking フィールドを外す。

そもそも公式は思考を切らないことを勧めています。思考を無効にすると、Opus 5はまれに①ツール呼び出しを構造化データではなく本文テキストとして書いてしまう(呼び出しは実行されないまま、エージェントの会話履歴にそのゴミが残り続けます) ②<thinking> などの内部タグを回答に混ぜる、という不具合を起こすことがあります[2][3]コストを抑えたいなら、思考を切るのではなくeffortを下げるのが正しい方向です。

このほか、コードを1行も変えなくても体感が変わる点が3つあります[2]既定の回答が長くなる、エージェント作業中に進捗を報告する頻度が増える、サブエージェント(下請けのAI)に仕事を振りやすくなる。どれも次の章のとおり、プロンプト側で調整できます。

05 プロンプトから​「消す」べき指示

ここが今回いちばん実務的なポイントかもしれません。公式のプロンプトガイドは、Opus 5については足す指示より「消す指示」を先に挙げています[3]

ダークなエディタ画面。システムプロンプトの中の検証を命じる2行に取り消し線が引かれ、削除マークが付いている
賢くするために足すのでなく、モデルが自分でやることを邪魔しないために削る。

消すもの①:検証を命じる指示。「最後に検証ステップを入れて」「サブエージェントを使って確認して」。Opus 5は言われなくても自分の作業を検証するため、こうした指示は過剰検証を招き、品質は変わらないままトークンだけ増えます。AIを動かす仕組み(ハーネス)の側に検証ステップを別途組み込んでいる場合も同じです。

「最強モデル」より「強いharness」記事のサムネイル 関連記事 | モデルの周りの仕組みをどう組むか「最強モデル」より「強いharness」──frontier AIが"政策で止まる"時代のエージェント設計

消すもの②:再チェックを命じる指示。「答えをダブルチェックして」「返信前に再確認して」も、同じ理由で外します。モデル自身の自己修正と重なって、コストだけが増えます。

消すもの③:「考えるな/推論するな」というルール。 思考を無効にして運用している場合、この手の指示はむしろ内部タグの漏れを増やします。必要なら「回答に内部タグやシステムタグを含めないこと」と一般的な形で書くほうが効きます(タグ名を名指しするのは逆効果)。

消すもの④:レビュー時の「重大な問題だけ報告して」。 Opus 5はコードレビューの精度が上がり、指摘の多くが本物のバグになりました。ここで「保守的に」「重大なものだけ」と書くと、モデルが文字どおり受け取って報告を減らしてしまいます。全部報告させて、絞り込みは別のパスでやるのが公式の推奨です。

逆に足すべきものは、長さとスコープの制御です。

目的プロンプトの例(公式ガイドの主旨)
回答を短くしたい回答は要点に絞って簡潔に。注意書きは短くし、大部分を本題に使う
書き出すドキュメントを
膨らませたくない
文書の長さは必要に応じて。中身は網羅しつつ、埋め草の節や重複した要約を足さない
進捗報告を減らしたい最初のツール実行前に一文で何をするか言う。作業中は重要な発見か方針変更のときだけ短く報告する
サブエージェントの
濫発を防ぎたい
本当に独立した大きな作業のときだけ委譲する。数回のツール実行で終わる仕事は委譲しない。検証目的でサブエージェントを使わない
勝手に作業範囲を
広げさせたくない
頼まれたことを、頼まれた範囲で仕上げる。判断が分かれる場合だけ確認する

CAGでもClaude Codeを日々の実装・運用に使っていて、この記事の裏取りと公開作業もOpus 5の上で走っています。実感として効いたのは「検証しろ」を消す側でした。指示を足して賢くするのではなく、モデルが自分でやることを邪魔しない。プロンプトの手入れは、しばらく「削る作業」になりそうです。

06 安全面と、​使う​前チェックリスト

Anthropicは、社内の自動行動監査でOpus 5をこれまでで最もアラインした(意図に沿った)モデルと評価しています[1]。全体的な逸脱行動のスコアは2.3で、直近のモデルの中で最も低い数値です。Claude's Constitution(Claudeの憲法)の遵守はOpus 4.8・Sonnet 5・Fable 5より良く、欺瞞的な振る舞いの割合が最も低く、悪用に誘導されにくいとされています。

一方で、危険な用途についてはサイバーセキュリティと生物学の両分野でMythos 5より後ろにとどまるとも明記しています。脆弱性を「見つける」能力はMythos 5に近づいたが、それを「攻撃に仕立てる」能力は大きく後ろにある、という書き方です[1]。能力が上がったことを一律に危険だと煽らず、どの側面が上がってどの側面が上がっていないかを分けて出している点は、読む側にとって扱いやすい情報です。

運用面で知っておくとよいのがフォールバックの仕組みです。Opus 5のサイバー分類器はFable 5より緩く(介入頻度は約85%少ないと見込まれています)、それでも引っかかったリクエストは、Claude.ai・Claude Code・Claude CoworkではOpus 4.8に自動で回ります。APIでも有効にできます[1]。拒否して止まるのではなく、能力を一段落として続ける設計です。

同時にベータで2つの機能が出ています。会話の途中でツールを差し替えてもプロンプトキャッシュが無効にならない「mid-conversation tool changes」と、安全分類器に引っかかったリクエストを別モデルへ自動で回す「automatic fallbacks」[1][2]。加えて、キャッシュできる最小プロンプト長が1,024トークンから512トークンに下がりました[2]。短いプロンプトを繰り返し投げる用途のコストが下がります。

使う前チェックリスト

  • max_tokens を見直したか(思考が既定ONになり、思考+回答の合計が上限にかかる)
  • thinking: disabled を使っているなら、effortを high 以下にしたか(xhighmax は400エラー)
  • プロンプトから「最後に検証して」「ダブルチェックして」を削除したか
  • コードレビュー用プロンプトの「重大なものだけ報告」を外し、絞り込みを別パスに移したか
  • effortを既定のまま流用せず、自社の評価データで振り直したか(低い段で足りる処理が増えている)
  • 回答と生成ドキュメントが長くなる前提で、長さの指示を入れたか
  • Opus 4.1を使っているなら移行計画を立てたか(2026年8月5日に提供終了[4]

新しいモデルが出るたびに順位表を見に行きたくなりますが、今回いちばん財布に効くのは、同じ値段のまま、処理ごとに「考える深さ」を選び直せるようになったことのほうです。

AIの​導入判断で​迷っているなら

電脳技巧集団(AI職人ギルド)では、AIを使った開発・自動化のご相談を受け付けています。「うちの業務のどこに効くのか」から一緒に整理します。お問い合わせはこちら

出典・注記

  1. Anthropic「Introducing Claude Opus 5」(2026年7月24日)https://www.anthropic.com/news/claude-opus-5
  2. Anthropic公式ドキュメント「What's new in Claude Opus 5」https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
  3. Anthropic公式ドキュメント「Prompting Claude Opus 5」https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
  4. Anthropic公式ドキュメント「Models overview」(価格・スペック比較表、Opus 4.1の提供終了日)https://platform.claude.com/docs/en/about-claude/models/overview
  5. Anthropic公式ドキュメント「Effort」(各段階の推奨と、キャッシュとの関係)https://platform.claude.com/docs/en/build-with-claude/effort
  6. 本記事のベンチマーク数値はすべてAnthropicの自社発表であり、第三者による再現ではありません。Frontier-Bench v0.1の数値は同社の社内実行(mini-SWE-agentハーネス、GKEバックエンド、タスクごと5回試行の平均報酬)と注記されています。導入企業のコメント(Zapier・Box・Cursor・Devin等)は各社の自己申告です。いずれもCAG自身が検証したものではありません。

言語化できるものは、全て作る。

あなたの「作りたい」を、定価とスピードで形に。まずは無料の相談から。

制作事例を見る