強いAIほど「全員に同じ権限」を渡さない──AnthropicがCyber Verification Programを3段階へ拡大
シン@AI統制&マルチエージェント
AIの能力が上がるほど、考えるべきなのは「使えるか」だけではありません。



誰に、どの用途で、どこまでの権限を渡すか。
Anthropicは2026年10月6日、サイバーセキュリティ用途向けの「Cyber Verification Program(CVP)」を拡大し、アクセスを3段階に分けると発表しました。従来のCVPと、より高度な能力を扱うProject Glasswingを一つの仕組みにまとめ、利用者の身元、組織、用途、必要な安全管理に応じて利用範囲を変えます。
発表の面白さは、強いモデルを一律に開放するのでも、危険だから一律に閉じるのでもないところです。能力と権限を切り分け、審査・制限・監視を組み合わせて渡す。これはサイバー分野だけでなく、AIエージェントに仕事を任せる設計にも通じます。
何が変わったのか
新しいCVPには、次の3区分があります。
1. Defense Access
防御的なセキュリティ作業が対象です。企業、非営利団体、大学、政府、重要インフラ、小規模企業、オープンソースの保守担当者、実績のある個人研究者など、比較的幅広い利用者を想定しています。
Anthropicは、申請審査の目安を数日としています。
2. Red Team Access
許可を得た侵入テストやレッドチーム演習まで扱える区分です。対象は組織に限られ、危険度の高い操作にはリアルタイムの制限が残ります。審査は数週間を想定しています。
3. Specialized Access
航空、電力網、通信、銀行間システム、政府ネットワークなど、安全上重要な環境での利用を想定した最上位区分です。ごく限られた検証済み組織が対象で、Anthropicは米国政府と連携した詳細審査を行うとしています。
Project Glasswingの既存参加組織は、現在のモデルについて再申請せず、この区分へ移行します。
3区分はいずれも、Claude Opus 5.5、Sonnet 5.5、Mythos 5.1と将来のモデルを対象にすると説明されています。ただし、これは一般向けの料金プランではありません。申請、身元・組織の確認、用途審査、セキュリティ管理を前提としたサイバー用途のアクセス制度です。
制限を減らすと、何が変わるのか
Anthropicは、サイバー課題の評価セット「CyScenarioBench」で、各アクセス区分の挙動を比較しています。10課題を各5回、合計50試行した結果です。
- 通常アクセスでは、50試行すべてが最初の指示で制限された
- Defense Accessでは、46試行が途中のどこかで制限され、4試行が成功した
- Red Team Accessでは、制限による停止はなく、Opus 5.5が34試行を完遂した
- 制限を外したSpecialized相当の基準では、完遂率は67.6%だった
ここで注意したいのは、図の指標が完全にはそろっていないことです。通常アクセスとDefenseは「制限された回数」、Red TeamとSpecialized相当は「完遂した回数・率」です。また、これはAnthropicによる自社評価であり、独立機関の再現結果でも、実運用での安全性や有効性を保証する結果でもありません。
それでも、設計上の変化は読み取れます。強い制限は危険な利用を止める一方、正当な防御作業も止める可能性があります。そこで「誰にでも同じ制限」ではなく、確認済みの利用者へ段階的に権限を広げるわけです。
高い権限には、監視と記録も付いてくる
CVPに参加する組織には、Anthropicが不正利用を監視できるよう、データ保持が求められます。
一方でAnthropicは、顧客管理のクラウドストレージと安全対策を組み合わせ、ゼロデータ保持を目指す「Enterprise Frontier Safeguards(EFS)」を今秋後半に提供する計画も示しました。それまでは、一部のFable/Mythos利用者がゼロデータ保持のままCVPを利用できる例外も案内されています。
提供経路はClaude Platform、Google Cloud Vertex AI、Microsoft Foundryです。Amazon Bedrockでは、EFSの対象となる顧客に限ると説明されています。利用可能性は契約・審査・地域・提供基盤によって変わるため、一般の利用者が今すぐ同じ機能を使えるという意味ではありません。
実績として示された数字は、どう読むべきか
Anthropicによると、Project Glasswingの参加組織は2026年4月から7月までに、少なくとも129,000件の脆弱性を検証しました。Anthropic自身のスキャンでは、4月から10月にさらに5,500件を確認し、合計のうち33,000件超がCriticalまたはHighと評価されたとしています。
ただし、これらはAnthropicと参加組織の報告をまとめた数字です。各組織で重複処理や重要度判定が異なり、修正済み件数を開示した組織は半数未満でした。したがって、発見数をそのまま独立検証済みの効果や、実際に修正された件数として扱うことはできません。
「少なくとも5倍の影響がある」という推定もAnthropic側の見積もりであり、確定値ではありません。
MORIの運用へ翻訳すると「能力 ≠ 権限」
CVPから持ち帰れるのは、サイバー技術そのものより、AIへ仕事を任せるときの権限設計です。
- 誰が、何のために使うかを確認する
- 最初は必要な範囲だけ渡す
- 実行中にも危険な操作を止める
- 何をしたか記録し、異常を監視する
- 実績と必要性を見て、権限を見直す
つまり「このAIはできるから許可する」ではなく、「この作業に必要で、利用者を確認でき、追跡できるから許可する」という考え方です。
MORIのSafe Delegationに当てはめるなら、調査、下書き、外部公開、課金、契約、重要データの変更を同じ権限で扱わない設計になります。AIの能力が上がるほど、承認境界、実行ログ、停止条件、見直しの仕組みが大切になります。
これはAnthropicの発表から読み取った運用上の解釈であり、AnthropicがMORIの設計を評価・推奨したという意味ではありません。
まとめ
AnthropicのCVP拡大は、強いAIの安全な提供方法を「使わせる/使わせない」の二択から、確認済みの利用者へ段階的に権限を渡す設計へ進めた発表です。
- Defense、Red Team、Specializedの3段階
- 用途と利用者に応じて審査と制限を変更
- 高い権限には監視・記録・詳細審査を組み合わせる
- 自社評価では、制限を弱めるほど課題完遂が増えた
- 実績数字と安全性はAnthropicの報告であり、独立検証とは分けて読む
強いAIに必要なのは、能力を隠すことでも、無条件に解放することでもありません。能力、権限、検証、記録を別々に設計すること。 ここが、AIエージェントを長く安全に働かせるための重要な一歩です。
出典
Anthropic, Expanding the Cyber Verification Program, 2026年10月6日発表(本文・評価結果・提供条件・報告実績の一次資料)
- Anthropic, Expanding the Cyber Verification Program, 2026年10月6日発表(本文・評価結果・提供条件・報告実績の一次資料)
