Microsoftが2026年7月27日、Project Perceptionという新しいセキュリティシステムを発表しました。パブリックプレビューは2026年8月3日に始まります。
新しいのは、AIの役割が変わったことです。これまでの企業向けセキュリティAIは、担当者の質問に答えて調査を助ける「相談相手」でした。Project Perceptionは、弱点を探し、脅威を調べ、設定を直すところまでを、AIエージェント自身が実行します。Microsoft自身がこの違いを 「AI that assists(助けるAI)」と「AI that acts(実行するAI)」 という言葉で説明しています[1]。
この記事で分かることは5つです。①何が発表されたのか、②赤・青・緑という3種類のエージェントがどう連携するのか、③「AIが手を動かす」システムで人間の統制はどこに残っているのか、④同時に発表された自社製セキュリティモデルの数字(CyberGym 96%)は何を意味するのか、⑤費用はどう決まるのか。
なお、CAGはProject Perceptionを検証していません。以下の数値・仕様はすべてMicrosoftの公式発表と公式ドキュメントに基づきます。
01 何が発表されたのか ──システムとモデルが同じ日に出た
7月27日の発表は2本立てでした。運用を回すシステムと、その中で推論を担うモデルが同時に出ています。
| 発表物 | 内容 | 提供状況 |
|---|---|---|
| Project Perception | 赤・青・緑のAIエージェントがセキュリティ運用を回すシステム | 2026年8月3日 パブリックプレビュー開始 |
| MAI-Cyber-1-Flash | Microsoft初の自社製サイバーセキュリティモデル | MDASH(後述)経由・審査を通った防御側のみ |
Project Perceptionの提供は、まずMicrosoft Defenderの中から始まります。時間をかけて他のMicrosoft Securityの製品へ広げていく、と公式FAQに書かれています[1]。いきなり独立した新製品を買う話ではなく、すでにDefenderを使っている組織に機能として降りてくる形です。
Microsoft Security担当のエグゼクティブ・バイスプレジデントであるHayete Gallot氏は、発表ブログでこう位置づけています。攻撃側のコストが下がり続ける一方、守るべき対象の量と複雑さは増え続けている。人間の担当者を前提に組まれた仕組みでは、機械の速度で来る攻撃に追いつけない[2]。
02 赤・青・緑 ──引き継ぎを挟まずに繋がる3つの役割
中身でいちばん分かりやすいのが、エージェントを3つの役割に分けたことです。セキュリティの現場で以前から使われている「レッドチーム(攻撃役)」「ブルーチーム(防御役)」という言葉を、そのままエージェントの分担にしています。
| 色 | 視点 | やること |
|---|---|---|
| 赤(Red) | 攻撃者の視点 | 侵入経路になりうる弱点を、攻撃者に使われる前に見つける |
| 青(Blue) | 調査役の視点 | 文脈をもとに調べ、どれが本当に意味のあるリスクかを判断する |
| 緑(Green) | 修復役の視点 | 修正を実行し、環境全体の防御を固め直す |
重要なのは、この3つが人間の引き継ぎを挟まずに情報を共有する点です。公式の製品ページは、発見がそのまま修正になる、毎回の引き継ぎなしで(a finding becomes a fix, proactively, without a hand-off at every step)と書いています[1]。
現場の感覚に置き換えると、こういうことです。従来は「スキャンツールが警告を大量に出す → 担当者が本物かどうか仕分ける → 別の担当者がチケットを切る → 修正されるのは数週間後」という流れでした。実務でいちばん詰まるのは、この受け渡しの部分です。3種類のエージェントが同じ文脈を共有するというのは、ここを減らすという主張になります。
Microsoftはこの循環を「閉ループ(closed-loop)」と呼び、発見・評価・改善を継続的に回すと説明しています[2]。
03 スタックは6層 ──「エージェントを足した」のではない
Gallot氏は発表ブログで、エージェント型のセキュリティは既存のワークフローにエージェントを足すだけでは実現しないと書き、6つの層からなる新しい「サイバースタック」を示しています[2]。
AI導入を考える立場から見て示唆的なのは、「セキュリティコンテキスト」の層です。エージェントに毎回、生ログから状況を組み立て直させるのではなく、資産・ID・関係性・リスク・活動の最新像を共有の形で持たせておく。公式ブログはその狙いを、推論の正確さと一貫性を上げると同時に、規模を保って動かすのに必要な時間・計算・コストを減らすためと説明しています[2]。
「AIに文脈を持たせる」という話は精度の問題として語られがちですが、Microsoftはここでコストの問題としても書いています。エージェントを常時動かす設計では、毎回の状況把握そのものが費用になるからです。
04 CyberGym 96%の読み方 ──それは「モデル」の点数ではない
同時発表されたMAI-Cyber-1-Flashは、Microsoft初の自社製サイバーセキュリティモデルです。Microsoft AIのCEOであるMustafa Suleyman氏と、前出のGallot氏の連名で発表されました[3]。
公表された数字を並べます。
| 項目 | 数値 | 補足 |
|---|---|---|
| CyberGymスコア | 96% | MDASH+MAI-Cyber-1-Flashの構成 |
| Mythosとの差 | +12ポイント | Mythos=Anthropicが2026年4月に発表した防御特化モデル[4] |
| 2026年5月時点のMDASH | 88.45% | 当時の2位は83.1%[5] |
| コスト | 現行の最良構成比 約50%減 | 比較対象は GPT-5.4 + 5.4 mini + 5.3 codex[3] |
ここは読み違えやすいので、公式の書き方をそのまま押さえておきます。96%はモデル単体のスコアではありません。 MDASHという100以上のエージェントを束ねるハーネスに組み込んだ「システム」としてのスコアです。原文は the unified system of MDASH with MAI-Cyber-1-Flash delivers 96% on CyberGym と書いています[3]。
一方、比較対象のMythosは単体のモデルです。同じ土俵の比較ではない、と読むのが正確でしょう。
CyberGymは、188のOSS-Fuzzプロジェクトから集めた1,507件の実在した脆弱性を再現できるかを測るベンチマークで、コードベース全体を読んで実際のバグを見つけられるかを問います[5]。抽象的なクイズではなく実物のコードが相手になるため、この領域では評価の重い指標とされています。
05 9割を小さいモデル、1割だけ高いモデル ──コストが設計の中心にある
MAI-Cyber-1-Flashの発表で、技術そのものより実務に効く話がひとつあります。使い分けの比率を公表したことです。
公式記事はこう書いています。セキュリティは常時稼働の仕事であり、流れ込む攻撃の量を考えると、いまやトークンのコストが守る側の本当の制約になっている。MAI-Cyber-1-Flashは全タスクの最大90%を効率よく処理するよう設計され、MDASHは残り10%の「本当に難しいタスク」にだけ、艦隊の中で最も大きく高価なモデル(この場合はGPT-5.4)を使う[3]。
つまりMicrosoftは、自社の看板モデルで全部やる構成にしていません。9割を自社の小さいモデルで捌き、1割だけ他社の高いモデルに投げる。その結果が、現行の最良構成に対して約50%のコスト削減という数字になっています。
この「小さいモデルで大半を処理し、難所だけ大きいモデルに回す」という考え方自体は、AIを業務に組み込む場面では一般的な設計です。目を引くのは、その比率と削減幅を公表したことのほうでしょう。
関連記事 | 常時動くAIの費用の考え方AIを全社に入れたら、今度は「使いすぎ」に悩み始めた ──AIエージェント時代の本当のコストは、月額ではなくトークンで決まる
→
06 人間の統制と、費用の決まり方 ──何をさせないかが書かれている
「AIが自分で修正まで実行する」と聞くと、統制が心配になります。ここは公式が繰り返し書いている部分なので、原文の表現を押さえておきます[1][2]。
- 機械の速度で推論・優先順位づけ・実行を行いながら、人間をしっかりと統制側に置いたまま(
keeping humans firmly in control) - 守る側が目的とガードレールを設定し、影響の大きいアクションはすべて人間の承認のもとに置かれる(
every high-impact action stays under human sign-off) - エージェントが作業を担い、人間が判断を担う(
Agents carry the work; humans carry the judgment) - すべての決定はスコープが限定され、追跡可能で、再生可能(
scoped, traceable, and replayable)
モデル側にも制約が置かれています。MAI-Cyber-1-Flashは防御用途にキャリブレーションされ、審査を通った防御側(verified defenders)にのみMDASH経由で提供されます[6]。MicrosoftのAI Red Teamによる評価、専門家による敵対的テスト、第三者による独立評価も実施したとしています。実行環境はインターネット接続のないサンドボックスで、ロールベースのアクセス制御・テナント分離・暗号化・監査可能性が備わります[3]。
自律的に動くエージェントに権限を渡す設計では、「何ができるか」より「何をさせないか」をどう担保したかのほうが読みどころになります。この発表は、その部分を明文化している側に入ります。
費用はどう決まるのか
価格体系も公表されています。従量課金(consumption-based, pay-as-you-go)で、単位はSCU(Security Compute Unit=セキュリティ計算単位)です[1]。
- エージェントがポータル上でシナリオを実行するとSCUを消費する
- 負荷の重いタスクほど多くのSCUを消費する
- エージェントの種類によって消費レートが違う
定額のライセンスではなく、動かした分だけ払う形です。導入を検討する側から見ると、上限をどう設計するかが運用の主題になるタイプの課金と言えます。
07 まとめ ──「助言するAI」と「実行するAI」は併存する
Microsoftは、既存のSecurity CopilotとProject Perceptionの関係についてもFAQで答えています。置き換えではなく、役割が違うので一緒に使うという整理です[1]。
| Microsoft Security Copilot | Project Perception | |
|---|---|---|
| 位置づけ | 生成AIによるチャット型の支援 | エージェント型のシステム |
| Microsoftの表現 | AI that assists(助けるAI) | AI that acts(実行するAI) |
| 人間の関わり | 人が質問し、人が実行する | エージェントが実行し、人が目的と承認を握る |
| 提供開始 | 提供済み | 2026年8月3日 パブリックプレビュー |
| 入口 | チャット画面 | まずMicrosoft Defenderの中から |
| 課金 | 別体系 | 従量課金(SCU) |
この記事の要点を3つに絞ります。
- 役割分担が製品の形になった ── 赤(見つける)・青(調べる)・緑(直す)を別々のエージェントに割り当て、人間の引き継ぎを挟まずに繋いだ。
- 数字は「システム」のもの ── CyberGym 96%はMDASHというハーネス込みのスコアであって、モデル単体の点数ではない。比較対象のMythosは単体モデルであり、土俵は同じでない。
- コストが設計の中心にある ── 9割を小さいモデル、1割だけ高いモデル。課金はSCUの従量制。常時動くエージェントでは、精度と同じ重さでコストが設計対象になる。
パブリックプレビューは8月3日。実際に何ができて、SCUが実運用でどれくらい積み上がるのかは、そこから先の話になります。
電脳技巧集団(AI職人ギルド)
AIを業務に入れるときの設計・実装を、企画から運用まで手がけています。ご相談は お問い合わせ から。
出典・脚注
- Project Perception 製品ページ(Microsoft Security)。赤・青・緑の連携(
a finding becomes a fix, proactively, without a hand-off at every step)、人間の統制(every high-impact action stays under human sign-off/Agents carry the work; humans carry the judgment/scoped, traceable, and replayable)、提供範囲(At launch, Project Perception brings multi-agent coordinated defense directly into Microsoft Defender)、価格(consumption-based, pay-as-you-go pricing ... measured in Security Compute Units (SCUs))、Security Copilotとの違い(AI that acts / AI that assists)はFAQより。microsoft.com/en-us/security/business/ai-powered-cybersecurity/project-perception-agentic-system - Hayete Gallot「Rethinking security for the age of AI」The Official Microsoft Blog、2026年7月27日。赤・青・緑の定義、6層のサイバースタック、セキュリティコンテキストの狙い、
keeping humans firmly in control、8月3日パブリックプレビュー。blogs.microsoft.com/blog/2026/07/27/rethinking-security-for-the-age-of-ai/ - Mustafa Suleyman、Hayete Gallot「Introducing MAI-Cyber-1-Flash inside MDASH」Microsoft AI、2026年7月27日。
up to 90% of all tasks、(in this case GPT-5.4) for the 10% of exceptionally hard tasks、the unified system of MDASH with MAI-Cyber-1-Flash delivers 96% on CyberGym (+12 pt above Mythos)、50% cost saving when compared against our best offering in MDASH today (GPT 5.4 + 5.4 mini + 5.3 codex)、MDASHの100以上のエージェント、AI Red Team評価・第三者評価、サンドボックス/RBAC/テナント分離。microsoft.ai/news/introducing-mai-cyber-1-flash-inside-mdash/ - Mythosの提供元・発表時期は、Microsoftの発表内では明示されていない。Anthropicが2026年4月7日に発表した防御特化モデル「Claude Mythos」であり、CyberGymで83.1%とされることは第三者報道による。CAG自身の検証ではない。
- 「Defense at AI speed: Microsoft's new multi-model agentic security system tops leading industry benchmark」Microsoft Security Blog、2026年5月12日。
reaches an 88.45% success rate ... roughly five points above the next entry, 83.1%、CyberGymの構成(1,507 real-world vulnerability reproduction tasks drawn from across 188 OSS-Fuzz projects)。microsoft.com/en-us/security/blog/2026/05/12/defense-at-ai-speed-... - MAI-Cyber-1-Flash モデルページ(Microsoft AI)。
calibrated for defense and available only to verified defenders through MDASH、MDASHの処理フロー(Prepare / Scan / Validate / Dedupe / Prove)、Handles up to 90% of MDASH tasks。microsoft.ai/models/mai-cyber-1-flash/
※ 本記事の数値・仕様はすべてMicrosoftの公式発表および公式ドキュメントに基づく。CAG自身による検証・計測は行っていない。









