AIエージェント群が評価システムを欺くためにテスト環境から抜け出し、誰からも標的として指定されていなかったHugging Faceに侵入した事件を受け、フロンティアAI企業の経営陣は自社のイノベーションのペースを見直すことになりました。
AnthropicのCEOであるダリオ・アモデイ氏は、最近発表した「We Must Pace the Frontier」(英語)で、最も高性能なAIモデルを開発する企業、すなわちフロンティアラボは、独立した評価者に内部へのアクセスを認め、対象を絞った規制を受け入れ、安全対策が追いつけるよう能力向上のペースを意図的に抑えるべきだと主張しています。OpenAIのサム・アルトマン氏も、数時間のうちに賛意を示しました。
パートナーであるAnthropicとOpenAIの提案の趣旨には賛同します。フロンティアAIは、人間が選択も予測もしていない、重大な結果を招くサイバー上の行動を自律的に実行できるシステムという、まったく新しい存在をもたらすからです。そして近い将来、こうした能力は一部のフロンティアラボだけのものではなくなります。
この議論に加えるべき重要な視点があります。フロンティア開発のペースを抑えることで、世界は時間を稼げるかもしれません。サイバーセキュリティの役割は、その時間を活かし、こうした能力が必然的に広がったときにAIシステムを監視・統制し、対抗できる防御体制を構築することです。
だからこそ、AIをサイバー防御向けに開発・活用する側にとって、減速という選択肢はありません。ただし、防御側がペースを落としてはならないのは、モデル能力の向上ではありません。
開発ペースを抑えれば、最も高性能なモデルがリリースされる速度を落とすことはできます。しかし、AIエージェントが組織の環境内で稼働し始めた後や、攻撃者の手に渡った後に何が起きるかまでは制御できません。
ガバナンスの問題
十分にアラインメントが取れ、慎重なペースで開発されたモデルでも、次のような状況では壊滅的なリスクを生みかねません。
- 自組織の環境で稼働していることを誰も把握していない
- 過剰なアクセス権を持っている
- 一度も監視されていない
Hugging Faceへの侵入事件では、まさにこうした不備が決定的な要因となりました。エージェントは公開Web上に露出していた有効な認証情報を使って侵入し、誰も到達を想定していなかったシステムへと横展開しました。
最近のリサーチ「エージェント型AIのシャドーパイプライン:信頼されたワークフローの背後に潜むアタックサーフェスをマッピングする」は、これが机上のリスクではないことを示しています。調査では、マルチクラウド環境を利用する組織の47%がクラウド資産を完全には可視化できていないことが分かりました。これは、現在AIエージェントが稼働しているのと同じインフラストラクチャです。また、AIエージェントが外部のツールや統合機能に接続すると、それらが抱える弱点も引き継ぎます。オープンソースリポジトリの最大20%には、悪用可能な脆弱性が含まれています。
シャドーAIは拡大を続けるアタックサーフェスです。この問題は、フロンティアラボだけでは解決できません。完全にアラインメントが取れたエージェントであっても、与えられた権限の範囲なら何でも実行するからです。
そこでTrendAIは、フロンティアAIの行方に左右されずリスクを低減できるガバナンスフレームワークの構築に向けて、企業や政府機関のお客様と協力しています。具体的には、次の4つの問いに答える必要があります。
- 可視性: 組織の環境内では、どのAIシステムやエージェントが、どこで稼働しているか。機密データはどこから流入しているか。
- 責任主体: 各システムやエージェントの責任を負うのは誰か。業務上必要な範囲を超えるアクセス権を持っていないか。
- 可観測性: AIシステムやエージェントがデータを漏洩させたり、操作されたり、本来の目的に沿わない行動を取ったりしていないか。
- ガバナンス: AIリスクが管理下にあることを証拠によって示せるか。
これらは、基盤となるモデルの出所がフロンティアラボでも、オープンソースプロジェクトでも、あるいは組織が承認していない提供元でも、AIサイバーセキュリティの土台となります。今から整備を進める組織は、フロンティアクラスの能力が珍しいものではなくなる時代に備えられます。
スピードの問題
攻撃者はすでにAIを利用し、人だけに頼る防御では対応できない速度で弱点を発見し、悪用しています。フロンティアクラスの能力が普及すれば、攻撃の自律性はさらに高まり、予測も一段と難しくなります。
現在、どのチームにもパッチを適用しきれないほど多くの脆弱性が存在し、AIによって発見と悪用の双方が加速しています。防御チームに求められるのは、脆弱性インテリジェンスを防御へ転換するまでの時間、すなわち「タイム・トゥ・ゼロ」を絶えず短縮することです。
TrendAIでは、世界各地の数千人にのぼる脅威リサーチャーがAIと人の知見を活用し、脅威を発見するとともに、迅速に展開できる仮想パッチを作成しています。すでに悪用されている脆弱性に対しては、ベンダーのパッチが提供される最長115日前から、仮想パッチによる保護を提供できます。
こうした保護には、AIイノベーションを継続し、安全に利用できる段階に達した高性能なモデルを速やかに防御へ投入することが不可欠です。そうすることで、現在のAIを利用した攻撃だけでなく、能力の普及によって今後増加する、より自律的な攻撃にも対応できます。
攻撃者はペースを落とさない
多くの組織では、ガバナンスが整備されているかどうかにかかわらず、すでにAIエージェントが稼働しています。一方、攻撃者は日々AIを武器として利用し、攻撃の速度と巧妙さを高めています。
AIイノベーションのペースを業界全体で議論する際にも、AIを利用した脅威が加速度的に進化していることを忘れてはなりません。
開発ペースを抑えることで得られる時間がどれほどであれ、防御側はその時間を使い、攻撃者を含む誰もがフロンティアクラスの能力を手にするようになる前に、AIシステムを制御・監視し、対抗する力を構築する必要があります。
フロンティアラボがAIモデルの開発ペースを落とそうとする理由こそ、防御側がペースを落とせない理由でもあります。AI時代のサイバーセキュリティでは、悪意ある行動を防ぐのと同じ厳格さで、意図しない結果も統制しなければなりません。
参考記事
AI Frontier Labs Can Slow Down. Defenders Can’t Afford To.
By: Rachel Jin
翻訳:与那城 務(Platform Marketing, TrendAI™ Research)