OpenAIが2026年8月10日、サイバーセキュリティ向けのプログラム「Daybreak」を Blue と Red の2つの層に分け、あわせて専用モデル GPT-5.6-Cyber を公開した[1]。守る側の担当者には、通常なら断られる質問にも答えるAIを渡す、という発表だ。
ただ「制限を外した」の一言でまとめると、中身を取り違える。公表された数字を並べると、Blueで外れるのはシステム側の遮蔽だけで、モデル自身の拒否はほとんど残る(高度な要求への回答率 1.5% → 2.0%)。95%まで跳ねるのは、専用に訓練し直したRedのモデルだけだ。しかもOpenAI自身が、その専用モデルが通常モデルに負ける評価を2つ公表している。
この記事で分かること——①何が発表されたのか ②「制限を外す」の2段階 ③95%はどこから来るのか ④専用モデルが常に上ではないこと ⑤実際に見つかった脆弱性 ⑥誰が使えるのか(審査と統制の中身)。
本文の数値・評価結果はすべてOpenAIの公表値で、CAG自身が検証したものではない。出典は末尾の脚注に置いた。
01 発表されたのは「2つの入口」と「1つのモデル」
Daybreakは、承認された防御側の担当者にフロンティアモデル(各社の最先端モデル)を渡すためのOpenAIのプログラムだ。今回、この入口が2つに分かれた。
| Daybreak Blue | Daybreak Red | |
|---|---|---|
| 渡されるモデル | GPT-5.6 Sol など汎用のフロンティアモデル | 専用訓練モデル(GPT-5.6-Cyber) |
| 想定する作業 | 脆弱性の発見、セキュアコードレビュー、マルウェア解析、インシデント対応、パッチ検証 | 認可された脆弱性研究、エクスプロイトの検証、セキュリティテスト |
| 位置づけ | ほとんどの防御担当者にとっての出発点 | 高度な研究・レッドチーム向け |
OpenAIは公式に「ほとんどの防御担当者にはBlueを出発点として推奨する」と書いている。Redは、認可された業務に高度な脆弱性研究・エクスプロイト開発・レッドチーミングが含まれるチームが申請する形だ。
用語をひとつだけ補っておく。レッドチームとは、攻撃側の視点で自社のシステムに侵入を試み、守りの穴を実地で洗い出す担当のこと。BlueとRedという名前は、セキュリティ業界の慣用(守る側=ブルーチーム、攻める側=レッドチーム)から来ている。
02 「制限を外す」は2段階ある ──Blueで外れるのはシステム側の遮蔽だけ
ここが、見出しからは読み取れない部分だ。
OpenAIは通常、モデルの外側にシステムレベルの安全装置を置いて、サイバーセキュリティ関連の要求を選別している。悪用を防ぐためだが、同時に正当な防御作業まで止めてしまう。Daybreak Blueは、この外側の装置を外す。
外れるのは、あくまで外側だけだ。モデル自身の判断は残る。公式にもこう書かれている——システムレベルの安全装置がなくても、本番システムへのペネトレーションテスト(許可を得たうえで実際に侵入を試みる検査)のように、使い道が善にも悪にも振れる要求には GPT-5.6 Sol は応じない、と。
それが数字にはっきり出ている。OpenAIが社内評価「Advanced Cybersecurity Completion Rate」(エクスプロイトチェーンの開発、認証バイパス、権限昇格といった高度な要求に、モデルがどれだけ応じるかを測る指標)で公表した回答率は次のとおり[1]。
1.5%から2.0%。 Blueで外側の遮蔽を取り払っても、この指標ではほとんど動かない。「ガードレールを外した層」という言葉から想像するものとは、だいぶ違う。
とはいえBlueに意味がないわけではない。この指標が測っているのは高度な要求への回答率であって、Blueが効くのはもっと日々の作業のほうだ——インシデントの検知と対応、調査、脆弱性管理、セキュリティ評価。普段の守りの仕事が、安全装置に誤って止められなくなる。それがBlueの価値になる。
03 95%まで跳ねるのは、訓練し直したモデルだけ
では95%はどこから来るのか。モデルそのものを訓練し直したからだ。
GPT-5.6-Cyberは GPT-5.6 Sol をベースに、ゼロデイ脆弱性(まだ知られておらず、修正パッチも存在しない弱点)の発見やエクスプロイトチェーンの開発といった専門作業の能力を上げ、同時にリスクの高い両用(デュアルユース)の要求に対する拒否を減らすよう訓練されている。
「拒否を減らす」がわざわざ訓練目標として書かれているところに、この発表の性格が出ている。OpenAIは旧世代の GPT-5.5-Cyber について、持続的な拒否に遭遇したというセキュリティ研究者からのフィードバックに応えたものだと説明している。守る側にとっては、AIが断ること自体が業務の障害になっていた、ということだ。
公式ページには実際のやり取りの例も並んでいる。macOSのキーチェーン(パスワードなどを保管する仕組み)の確認をバイパスするコードを求めるプロンプトに対し、応じたのは GPT-5.6-Cyber(Red)だけ。GPT-5.6 Sol は安全装置の有無にかかわらず断り、旧世代の GPT-5.5-Cyber も断っている。
04 それでも、専用モデルが常に上ではない
この発表でいちばん誠実なのがここだ。OpenAI自身が、専用モデルが負けた評価を2つ公表している。
ひとつは社内の「Vulnerability Discovery and Report Writing」評価。既知の脆弱性があるリポジトリを渡し、脆弱性を見つけ、実際に動く実証コードを作り、報告書を書かせる。この評価でGPT-5.6-Cyber は GPT-5.6 Sol より低い。OpenAIは理由をこう書いている——モデルが短く、詳細さに欠ける脆弱性報告を出すことがあるため、と。
もうひとつはExploitBench。V8(Chromeが使っているJavaScript実行エンジン)の脆弱性を、実際に動くエクスプロイトへ仕上げられるかを測る評価だ。標準設定(エージェントの手数を300ターンに制限)では、GPT-5.6 Sol(Daybreak Blue)のほうがトークン効率よく解き、成績も最も良い。600ターンまで広げると差は縮まる、とされている。
つまり「専用モデルのほうが強いからRedを申請する」という理解は正しくない。脆弱性を見つけて人が読める報告に仕上げる仕事では、汎用モデルのほうが良い結果を出す領域がある。ここを取り違えると、より制限の緩い層を申請したのに、成果物の質が落ちるという逆転が起きる。
05 実際に何が見つかったのか ──ChromeのV8に採番されたCVE
ベンチマークだけでなく、実物の成果も公表されている。
OpenAIは GPT-5.6-Cyber の訓練が終わってから、実在のソフトウェアの調査に使ってきた。ChromeのJavaScriptエンジンであるV8では、未知の脆弱性を2つ発見。この2つを連鎖させるとメモリを破壊し、V8のヒープサンドボックス(万一の侵害をブラウザ内部に閉じ込めるための隔離領域)から脱出できる状態だった。研究者が検証したうえで協調的開示の手順に沿ってGoogleに報告し、Googleが修正、CVE-2026-15903 として採番されている。
中身としては、最適化コンパイラが値を整数へ変換する際に安全確認を飛ばしてしまい、undefined が想定外に大きな数値を生む、というものだ。その数値が配列の添字として使われると、コンパイラが「配列の範囲内だ」と誤って判断して境界チェックを省く。結果、別のオブジェクトが使っているメモリを読み書きできてしまう。
公表されている成果はこれだけではない。
| 対象 | 公表された内容 |
|---|---|
| モバイルOS | 普及しているモバイルOSに5件以上の脆弱性。信頼されていないアプリから権限昇格に至る連鎖を含む |
| データベース | 普及しているデータベースに3件の重大な脆弱性。リモートからコード実行に至る経路を含む |
| OSカーネル | 普及しているOSカーネルに、権限昇格につながる脆弱性が400件超 |
これらは開示と修正の作業中とされ、製品名は伏せられている。モデルの実力を測る材料としては、ベンチマークの数値よりこちらのほうが具体的だ。件数の桁がそのまま、人手で追い切れる量を超えていることを示している。
06 誰が使えるのか ──能力ではなく「資格」で仕切る
制限を外したモデルを配る以上、渡す相手を絞る仕組みが要る。Daybreakの統制は次のような形になっている。
利用者側の審査。 BlueもRedも、認可された業務を行う個人・組織のみが対象で、身元確認、アカウントのセキュリティ、監視、用途の制限、そして法的な表明でアクセスを管理すると明記されている。さらに2026年9月1日から、Daybreakの個人アカウントはハードウェアセキュリティキーが必須になる。パスワードやアプリのコードではなく、物理的な鍵を挿して本人確認する方式だ。
エージェントの動きへの制約。 Codex(OpenAIのコーディングエージェント)を使う顧客には、全権限モードではなくauto-reviewモードへの切り替えを強く推奨している。高い権限を要する操作を実行前に評価し、破壊的な動きにつながる要求を止められる仕組みだ。あわせて、サンドボックスでの隔離、エージェントの操作の監視、権限範囲の明示が推奨事項として挙げられている。
パートナー経由でも、モデルは顧客に渡らない。 同じ日にOpenAIは、Accenture・IBM・PwC・Cisco・CrowdStrike・Cloudflareなど16社が参加するパートナープログラムの拡大も発表した[2]。ここで重要なのは、モデルそのものへのアクセスは承認されたパートナーに留まり、その顧客に直接渡されるわけではないと明記されている点だ。顧客が受け取るのは、パートナーが専門知識を通して仕上げた結果のほうになる。
そしてこの発表の3日前、OpenAIは別の告知を出している。開発中のモデルAstraの内部評価で、Preparedness Frameworkの「Critical(重大)」なサイバー能力を否定できないという結論に至った、というものだ[3]。Criticalとは、堅牢な実システムに対して人の介入なしに実際に機能するゼロデイのエクスプロイトを作れる水準を指す。OpenAIはこれを受けて隔離されたテスト環境・モデルの重みの保護強化・リスクのある動作の全面監視を導入し、新しいセキュリティ要件を満たさない社内活動を一時停止したとしている。
この記事で扱ってきた GPT-5.6-Cyber については、Preparedness Framework上は GPT-5.6 Sol と同じく High(高)に達するがCriticalには届かないと評価されている。訓練で直接狙った一部の専門作業では Sol を上回ったが、Criticalの水準には足りなかった、という説明だ。詳細な評価を載せたシステムカードは後日公開予定とされている。
攻撃側にその力が渡る前に守る側へ配る、というDaybreakの主張は、この文脈に置くと輪郭がはっきりする。急いでいるのは、渡す側のほうだ。
なお、7月に起きた Hugging Face への侵入事案については、OpenAIは今回の発表の中で GPT-5.6-Cyber も Astra も関与していないと明記している。
関連記事 | この事案を扱った解説AIエージェントが本番インフラに侵入した ──OpenAIとHugging Faceの事案を解説
→
07 まとめ ──今日の時点で読み取れること
| 見出しの印象 | 公式発表を読んだ実際 |
|---|---|
| 制限を外したAIを配り始めた | 外れるのはシステム側の遮蔽。Blueではモデル自身の拒否が残る(1.5%→2.0%) |
| 専用モデルのほうが強い | 応じる範囲は広い(95.0%)が、脆弱性の報告作成では汎用モデルに負ける評価をOpenAI自身が公表 |
| 申し込めば誰でも使える | 身元確認・監視・用途制限・法的表明で管理。9月1日から個人はハードウェアキー必須 |
| パートナー経由なら顧客も使える | モデルへのアクセスはパートナー止まり。顧客が受け取るのは成果物 |
もう少し一般化すると、ここで起きているのは「AIに何をさせないか」から「誰になら任せるか」へ、安全性の設計が移ったということだ。モデルの側で一律に断る方式には、悪用を防ぐと同時に正当な仕事まで止めるという副作用がある。その副作用が無視できない領域から順に、能力そのものではなく、渡す相手の資格と、使うときの環境(隔離・監視・人の確認)で仕切る方式へ切り替わりつつある。
この考え方は、セキュリティ以外でAIエージェントを業務に入れる場合にもそのまま効く。私たちも社内のエージェント運用では、権限をあらかじめ分けておくこと、実行前に人が確認する経路を残すこと、操作の記録を残すことを土台にしている。強いモデルを選ぶことと、任せて安全な状態を作ることは、別々の作業だ。
出典
- OpenAI「Expanding Daybreak as the Cyber Defense Window Narrows」(2026年8月10日)https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows/ / 本文中の回答率・評価結果はいずれもOpenAIによる公表値で、CAGが独自に検証したものではない。Advanced Cybersecurity Completion Rate はOpenAIの社内評価。
- OpenAI「Putting frontier cyber models in more trusted hands」(2026年8月10日)https://openai.com/index/putting-frontier-cyber-models-in-more-trusted-hands/
- OpenAI「Responding to the next frontier of critical cyber capabilities」(2026年8月7日)https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/
電脳技巧集団(AI職人ギルド)
AIの最新動向を、作る側の目線で解説しています。開発のご相談は お問い合わせ から。









