Skip to main content
Return to TrendAI™ セキュリティブログ
AIと新興テクノロジー

モデルアライメントを超えて:AIエージェントの全レイヤーを保護する

アライメントはモデルに善意を持たせることができますが、エージェントが本番環境で接触するハーネス、ツール、データを保護することはできません。真のエージェントセキュリティとは、エージェント自身が決して無効化できない強制力をもって、すべてのレイヤーを統制することを意味します。

AI一般業種テクノロジー・メディア・通信

先週公開した記事『AIフロンティア研究所は減速できても、防御側にはその余裕はない』で、開発スピードが緩むことはあっても防御側の歩みを止めるわけにはいかないと述べました。その中で特に強調した一節があります。「完璧にアライメントされたエージェントであっても、付与された権限の範囲内にある動作なら何でも実行してしまう」という点です。これを受けて、セキュリティリーダーからは当然のように次のような問いが寄せられます。「では、具体的に何を構築すべきなのか?」しかし多くの場合、その答えは依然としてモデル単体で始まり、モデル単体で終わってしまっています。この捉え方は的を射ていないと考えます。

フロンティア研究所のパートナー各社がアライメントや拒絶応答の強化、レッドチーミングへの投資を継続していることは正当であり、その取り組みは支持されるべきものです。アライメントはモデルに「善意」を持たせる基盤であり、これがなければ他のあらゆる対策の難易度が上がります。しかし、CISOや取締役会、政府機関のリーダーから「本番環境のエージェントを本当に信頼してよいのか」と問われた際、アライメントだけでは十分な答えになりません。

善意あるエージェントであっても深刻な被害をもたらす

たとえ完璧にアライメントされたモデルであっても、ポイズニング(汚染)されたコンテキストや過剰な権限を持つ認証情報を与えられれば、善意から自信を持って誤った判断を下してしまいます。そして、その判断に基づいて実際の行動に移ってしまいます。

解説記事『OpenAI・Hugging Faceインシデントの内幕:Hugging Faceのセキュリティ侵害事案』は、動作環境がセキュリティをいかに左右するかを浮き彫りにしました。この事案では、エージェントがテスト環境を逸脱し、公開サービス上に露出していた認証情報を利用してさらに認証情報を収集した上で、想定外のシステムへとラテラルムーブメント(水平移動)を展開しました。どれほど高度なアライメントが施されていたとしても、そうした認証情報を自動的に失効させることはできなかったはずです。

エージェントとモデルは同義ではない

AIエージェントについて議論する際、モデルそのものを思い浮かべがちです。しかし、本番環境で稼働するエージェントの実態は、大きく分けて次の3つの要素で構成されています。

  • 推論を担うモデル
  • プロンプトのルーティング、ツールの呼び出し、サブエージェントの生成、メモリ管理など全体のオーケストレーションを司るハーネス(実行基盤)
  • 実際のシステムへアクセスするためのツールとデータ:呼び出されるスキル、MCP(Model Context Protocol)サーバー、プラグイン、そして読み書きされセッション間で引き継がれるデータ

アライメントが対象とするのは、これらの中で最初の「モデル」のみに過ぎません。残る2つはソフトウェアとインフラストラクチャであり、従来と何ら変わらない脆弱性や障害パターンを抱えています。ハーネスの制御は乗っ取られたりリダイレクトされたりする恐れがあり、ツールはエージェントの権限で実行されるサードパーティ製コードに他なりません。さらに、データストア側にはエージェントを前提としたアクセス制御モデルが確立されていないケースが多く見られます。

エージェントは特権インフラそのものである

単一の質問に回答するチャットボットであれば、インシデント発生時の影響範囲(ブラスト半径)は限定的です。一方、自律的かつ継続的に稼働するエージェントはそうではありません。認証情報を保持し、セッションをまたいでコンテキストを記憶し、サブエージェントを生成しながら、各ステップで人間の承認を経ることなく本番システムに対して継続的に処理を実行します。これは、従来もっとも高い特権を付与してきた重要インフラとまったく同一の性質を備えていることを意味します。

この性質は、リスクの様相を大きく2つの側面から変容させます。第一に、エージェント自身が認証情報を保持しているため、あらゆるプロンプトインジェクションが認証情報の漏えいに直結する危険性を持つ点です。第二に、導入されるあらゆるサードパーティ製スキルが、信頼境界の内部で実行される未検証のコードと化す点です。

アライメントによってモデルに「データを持ち出そうとしない意志」を持たせることはできても、エージェントによるデータ持ち出しを技術的に「不可能」にすることはできません。また、読み込んだドキュメントが悪意を持って偽造されている事実を、アライメントだけでエージェントに見抜かせることも不可能です。

すべてのレイヤーを保護する

エージェントの安全性は、呼び出すモデル、稼働させるハーネス、そしてアクセス先のツールやデータのうち、最も強固な部分ではなく、最も脆弱な部分によって決まります。攻撃者は常に最も弱いレイヤーを標的にします。したがって、特定のレイヤーのみを選択して対策するのではなく、すべてのレイヤーを可視化、管理、監視、統制しなければなりません。

TrendAI Vision One™ プラットフォーム(エンタープライズサイバーセキュリティプラットフォーム) は、エージェントを支えるモデル、ハーネス、ツール、データの各レイヤーに対して包括的なAIセキュリティを提供します。

  • モデル層:プロンプトおよびレスポンスをインラインで検査し、プロンプトインジェクションやジェイルブレイク(脱獄)の試みを遮断するとともに、機密データの漏えいを未然に防ぐマスキング処理(リダクション)を実施します。
  • ハーネス層:エージェントがアクセス可能なツールやMCPサーバーを統制し、実行されるすべてのAPI呼び出しを検査します。また、AIアプリケーションのリリース前に脆弱性テストを実施します。
  • ツールおよびデータ層:スキルやMCPサーバーは十分な精査がなされないまま急速に拡大しているソフトウェアサプライチェーンです。実行時におけるスキルやAIアーティファクトの挙動を詳細に分析します。さらに、AIに供給される機密データを検出・分類し、権限のないデータへのアクセスを阻止するとともに、企業で実績のあるファイルセキュリティやデータ漏えい防止(DLP)機能を、エージェントが読み書きするファイルにも拡張適用します。加えて、エージェントをはじめとするマシンIDなどの非人手アイデンティティから過剰な権限を剥奪します。
  • 全レイヤー横断:AIテレメトリをエンドポイント、ネットワーク、アイデンティティの各シグナルと相関分析することで、乗っ取られたエージェントが検知を逃れてラテラルムーブメントを行うことを許しません。

強制力をエージェントの手の届かない領域に置く

この点こそ、顧客企業に対して最も強く強調しているポイントです。エージェントが自らの設定を書き換えたり、新たなスキルを読み込んだり、組み込まれたフックを無効化できたりするのであれば、そのセキュリティ制御は単なる「推奨事項」に過ぎません。自己強制に頼るセキュリティは、強制力を持たない提案と同義です。だからこそ、NVIDIA社が発表した「NVIDIA Agent Safety Platform」への支持を表明しています。このプラットフォームはエージェントの下位にあるインフラ層に権限を配置する設計となっており、TrendAI Vision One™ がそれと連携して可視化、管理、監視、統制を包括的に担います。

NVIDIA社によると、NVIDIA Agent Safety Platformは、エージェント自身が決して回避できないフルスタックのガバナンスと統制機能に対するニーズに応えるものです。この設計には、CPU上で稼働するエージェントにセキュリティ境界を提供するオープンソースの「NVIDIA OpenShell」ランタイムや、NVIDIA BlueField-4 DPU上で動作しNVIDIA DOCAを基盤とするアウトオブバンドの監視機構「NVIDIA Sentry」が含まれます。これにより、ハードウェア(シリコン)レベルでエージェントの挙動を常時監視し、セキュリティポリシーを強制適用することが可能になります。

エージェントは孤立した環境で動いているわけではない

エージェントといえども本質的にはワークロードの一つであり、従来のセキュリティスタック全体が依然として適用されます。そのため、NVIDIAのエージェント保護機能を単一プラットフォーム上でAIファクトリー全体へと拡張し、エージェント、モデル、コンテナ、ストレージ、ネットワークまでを網羅しています。検知機能はNVIDIA BlueField DPUおよびDOCAのテレメトリを活用しているため、ホストOSが侵害された場合でも高い信頼性を維持します。すべてのレイヤーにわたるシグナルを相関分析することで、セキュリティチームはエージェントの挙動、内在するリスク、そして具体的な対処手順を単一の画面で把握できます。

これらの根底にあるのが「可視性」です。存在すら把握していないシャドーAI、未管理のエージェント、無許可のMCPサーバーを統制することは不可能です。独自調査によると、エージェントが稼働している基盤であるマルチクラウド環境において、自社のサイバー資産を完全に可視化できていない組織は47%に上ります。あらゆる統制策に先立ち、まずは「発見」することから始めなければなりません。

セキュリティリーダーが最初に取り組むべきこと

すべての組織は、「可視性」「オーナーシップ(責任所在)」「サプライチェーン」「ガバナンス」の4つの領域において明確な対策を講じる必要があります。具体的には、以下のステップから着手することが推奨されます。

  • 可視性:正式な承認を得ていないものも含め、エージェントの棚卸しを実施してください。未知のエージェントが既に存在しているという前提で臨む必要があります。
  • オーナーシップ:エージェントを責任者が明確に定められた特権アイデンティティとして扱ってください。本番環境へのアクセス権を持つサービスアカウントと同等に、付与する認証情報のスコープを極限まで絞り込むことが重要です。
  • サプライチェーン:スキルやMCPサーバーをサードパーティ製コードと見なしてください。それらのツールが実際にどのように振る舞うかを監視し、エージェントがアクセス可能な範囲を厳密に制限してください。
  • ガバナンス:ポリシーの強制機構をエージェントの外部へと移管してください。エージェント自身の手で無効化できてしまう仕組みは、もはや制御と呼ぶことはできません。

AIエージェントの安全性とセキュリティを両立させることは十分に可能です。そのためには、稼働中のエージェントを正確に把握し、アクセス権を厳格に管理し、利用するツールを統制した上で、万一エージェントが侵害された場合でも無効化できないインフラ層に強制力を持たせることが不可欠です。

この安全保障を単独で成し遂げられる組織は存在しません。NVIDIA社はエージェントの実行権限を決定づける境界を構築しています。そしてTrendAI™は、その境界をどこに設けるべきかを指し示す脅威インテリジェンス、境界内部の動態を捉える可視性、そして即座に対応するためのセキュリティ運用機能を提供します。これこそが、NVIDIA社およびAIエコシステムのパートナー各社とともに推進しているセキュリティアーキテクチャです。

NVIDIA Agent Safety Platformへの対応に関する詳細については、プレスリリース『TrendAI™ Extends the NVIDIA Agent Safety Platform with Threat Intelligence and Full AI Factory Security』をご参照ください。

参考記事:

Beyond Model Alignment: Securing Every Layer of the AI Agent

By: Rachel Jin

翻訳:与那城 務(Platform Marketing, TrendAI™ Research)