Skip to main content
Return to TrendAI™ セキュリティブログ
AIと新興テクノロジー脆弱性とエクスプロイト

AIへの信頼がアタックサーフェスになるとき:プロンプトインジェクション、モデル盗難、パイプライン汚染の分析

本分析では、AIに対する攻撃が単なる「悪意あるプロンプト」の領域を超え、組織がすでに信頼しているツール、モデル、パイプラインそのものへと移行している実態と、リスクへの露出を低減するために組織が導入できるセキュリティ対策について解説します。

エクスプロイトとゼロデイテクノロジー・メディア・通信AI

Key Takeaways

  • 近年の研究や実際のインシデントから明らかなように、プロンプトインジェクション、汚染されたMCPツールやスキル、侵害されたモデルサプライチェーン、悪意あるAIアプリケーションによって、信頼されていたAIワークフロー自体が新たなアタックサーフェスへと変貌しています。
  • これらの手法は、機密データの漏洩、不正な操作の実行、悪意ある挙動の永続化、ソフトウェアやモデルのサプライチェーン侵害を引き起こし、AI特有のリスクをエンドポイントにまで拡大させる恐れがあります。特に、AIエージェントに特権ツールや下流システムへのアクセス権が付与されている場合、その影響は甚大です。
  • テクノロジー、メディア、通信業界の企業は、ソフトウェア開発、コンテンツ配信・レコメンデーションのパイプライン、カスタマーサポート、業務の自動化などにAIを組み込んでいるため、特に大きなリスクに直面しています。これらの攻撃の多くは、従来のマルウェアや一目で悪意があるとわかるリクエストではなく、「信頼されたコンテンツやワークフロー」を逆手に取って実行されます。組織はベストプラクティスを導入することで、AI関連のリスクを軽減できます。具体的には、エージェントへのアクセス制御の適用、モデル出力の検証、高リスクなアクションに対する人間による承認(Human-in-the-Loop: HITL)の維持、モデルおよび依存関係の出所(来歴)の検証、モデルやエージェントの異常動作の監視などが挙げられます。

2025年6月、セキュリティ研究者らは、攻撃者が標的環境内のキーボードに一切触れず、誰にもリンクをクリックさせることなく機密データを盗み出せる手口を公表しました。その侵入経路となったのは、たった1通のメールでした。Microsoft 365 Copilot がそのメールを取得し、内部に潜んでいた指示に従ってしまった結果、機密データが外部へ流出しました。ユーザの操作は一切不要で、マルウェアも従来の攻撃チェーンも存在しませんでした。研究者らはこれを、本番環境のAIエージェントに対する史上初の「ゼロクリック・プロンプトインジェクション」として、EchoLeak(CVE-2025-32711、CVSS 9.3)と命名しました。

これは実験室で作られたシステムに対する単なる理論上の攻撃ではありません。実際のテナントで稼働している Microsoft 365 Copilot に影響を与え、本来ユーザのためにコンテンツを取得・処理するはずの機能を逆手に取って悪用したものでした。

この問題はテクノロジー企業だけに留まりません。例えばメディア企業でも、同様にエージェント型のコンテンツ生成やパーソナライズのパイプラインを運用しています。こうした環境では、モデルの盗難やデータ汚染によって知的財産が漏洩したり、コンテンツモデレーションやレコメンデーションのモデルに悪影響が及んだりするリスクがありますが、プロンプト層の表面的な監視では検知できません。

通信業界も同様のリスクを抱えています。特に、設計上どうしても信頼できない入力を処理せざるを得ない顧客対応の音声・チャットサポートが該当します。また、MCP(Model Context Protocol)形式の連携によって自動化が進むネットワーク運用業務も影響を受け、インジェクションが成功すると不正な操作の実行やデータ漏洩につながる恐れがあります。

本稿の後半では、音声ベースのプロンプトインジェクション、運用支援システム/業務支援システム(OSS/BSS)連携におけるツールの汚染、コンテンツパイプラインにおけるIP盗難など、具体的な仕組みと新たな攻撃手法について詳しく掘り下げます。

EchoLeak が差し迫った課題である理由と、従来のセキュリティ対策では検知できない理由

第一に、プロンプトインジェクションという脆弱性クラス自体には「単一の修正パッチ」が存在しないという点です。プロンプトインジェクションは、OWASP(Open Web Application Security Project)の「LLMアプリケーションのTop 10(英語)」において、2023年版と2025年版(英語)の2回連続で第1位に位置づけられています。OWASP自身も、生成モデルの仕組み上、完璧な防止策は「依然として不明確」であると述べています。個別の不具合は修正できても、これはアーキテクチャの本質的な性質です。根本的なリスクはシステムレベル全体で緩和しなければなりません。

第二に、関連する脆弱性がすでに本番のAIツールで相次いで顕在化している点です:

  • GitHub Copilot Chat および Visual Studio において、CVE-2025-53773(CVSS 7.8)および CVE-2025-32711(Microsoft発表でCVSS 9.3)の影響が確認されました。
  • Cursor は、プロンプトインジェクションがコード実行につながる複数の脆弱性を公表しました。これには Cursor AI コードエディタにおける CVE-2025-54130(CVSS 9.8)が含まれます。

第三に、被害の影響範囲(ブラストレイディウス)がチャットボットの枠を越えてサプライチェーンにまで達している点です。例えば、2026年2月の初期調査では、エージェント用レジストリ「ClawHub」に登録されていた2,857件のスキルのうち341件が悪意あるスキルであることが判明し、そのうち335件が「ClawHavoc」キャンペーンに関連していました。また2026年3月には、オープンソースのスキャナ「Trivy」およびゲートウェイライブラリ「LiteLLM」を経由した攻撃チェーンにより、あるAIベンダーから約4TBのデータが漏洩したと報じられました(英語)。

従来の境界型セキュリティは、一見無害に見える脅威の「真の意図」を見抜くようには設計されていません。Webアプリケーションファイアウォール(WAF)は、リクエストの形式が正しいかどうかは確認できますが、LLMに読み取らせるために仕組まれた指示の背後にある意味まで把握することはできません。

これは、OWASPがプロンプトインジェクションを第1位に挙げた根本原因と同じです。LLMは正規の指示と信頼できない入力データを単一のチャネルで処理するため、両者を確実に区別する手段がありません。実際、TrendAI™ Research の調査では、6,000件以上のAI関連の脆弱性が特定され、分析された19,000件のMCPサーバ・リポジトリのうち最大8.6%に悪用可能な脆弱性が含まれていると推定されています。

要するに、攻撃者は企業のセキュリティチームを技術的に凌駕する必要はありません。AIシステムが本来の役割通りに動作するよう仕向けるだけでよいのです。つまり、「すでに与えられている権限を使って、誤った指示に従わせる」だけで攻撃が成立してしまいます。

3つの攻撃経路と、共通するセキュリティの死角

以下の各経路は、従来のセキュリティツールが検査を行わない層に着弾します。しかし、それぞれの経路に対してリスクや影響を低減できる対策が存在します。

プロンプトインジェクション:単一の解決策が存在しない脆弱性クラス

直接的インジェクション(Direct Injection)は、ユーザが悪意ある指示をプロンプトに直接入力することで発生します。一方、間接的インジェクション(Indirect Injection)は、メール、Webページ、検索されたドキュメントなど、モデルが後から読み込むコンテンツ内に指示を仕込んでおく手法です。これにより、直接的なプロンプトの枠外で指示が発効します。

Microsoft は、同社に報告されるAIセキュリティ脆弱性の中で、間接的インジェクションが最も広く利用されている手法の一つであると指摘しています(英語)。これは2025年8月の事例(英語)でも実証されており、LenovoのGPT-4搭載サポートチャットボット「Lena」に対し、わずか400語のプロンプトを与えるだけでCookieを窃取するツールへと変貌させることができました。

攻撃経路 セキュリティの死角 ビジネスへの影響 阻止・軽減策
直接的インジェクション ガードレール分類器はパターンベースであり回避可能です。攻撃成功率(英語)は50%〜85%に達し、適応型手法を用いると本番環境のガードレールに対しても85%を超えます。 ユーザ向けのプロンプト入力口のすべてが悪用の起点となり得ます。データ漏洩、ポリシー回避、音声合成によるブランド毀損コンテンツの生成などが含まれます。 構造化された入力処理を導入し、応答がユーザに届く前に出力検証を実施する。
間接的インジェクション ユーザが入力した内容ではなく、モデルが読み込んだコンテンツから発動します。ユーザ入力を検査するツールでは一切検知できません。 ゼロクリックでの侵害が可能です。EchoLeak が示すように、汚染された1通のメールやWebページが、エージェントが呼び出せるツールを通じて実際の不正操作を引き起こします。 アクセスするツールに対して最小権限の原則を適用し、信頼できる指示と信頼できないデータの間でコンテキストの分離を実施する。

モデル盗難とそれを支えるサプライチェーンの侵害

このカテゴリには2つの異なるリスクが存在します:

  • 直接的なモデル盗難:公開されてしまったAPIや不正なレジストリアクセスを通じて、モデルの重み(ウェイト)を外部へ持ち出す行為。テクノロジー、メディア、通信企業にとっては、何ヶ月もの研究開発(R&D)資産が一瞬で他者の手に渡ることを意味します。
  • サプライチェーン侵害:より巧妙な手口であり、パイプラインが取り込むモデル、パッケージ、ライブラリそのものに悪意あるペイロードが仕込まれるケースです。

2026年3月の Trivy スキャナと LiteLLM をめぐるインシデントはその深刻さを示しています。攻撃者は Trivy を侵害し、ひそかにリリースタグを改ざんしました。その足がかりを利用して、CrewAI、DSPy、Microsoft GraphRAG などのエージェントフレームワークの基盤となっているAIゲートウェイライブラリ「LiteLLM」の発行資格情報を奪取しました。攻撃者は悪意ある2つのバージョンを PyPI に公開。AIデータトレーニングプラットフォームの Mercor はその後、OpenAI や Meta に関連するソースコード、業務委託者の身元確認書類、トレーニング手法などのデータが漏洩したことを確認しました。その結果、Meta は同ベンダーとの取引を無期限で停止しました(英語)。

これを検知するために作られたスキャンツールも万全の砦ではありません。2025年12月、JFrog は標準的なスキャンツールである PickleScan をすり抜けながら、モデル読み込み時に任意のコードを実行できる3件のゼロデイ脆弱性(CVE-2025-10155、CVE-2025-10156、CVE-2025-10157、CVSS値はそれぞれ 7.8、9.3、7.8)を公表しました(英語)。これらは2025年6月にメンテナーへ報告されて9月までに修正され、JFrog が12月に技術詳細を公開しました。

教訓は「PickleScan が無力だった」ということではありません。スキャナによるファイル解析方法と実行時(ランタイム)の処理方法に齟齬がある限り、スキャナ単体では安全を保障できないということです。軽減策としては、Safetensors のような安全なシリアライズ形式の採用、来歴の検証とデジタル署名、サンドボックス環境でのモデル読み込みの実装などが挙げられます。

パイプライン汚染:セッション終了後も持続する攻撃

パイプライン汚染は「持続性(永続化)」を狙う手口です。単一のリクエストを乗っ取る代わりに、モデル、テンプレート、スキル、データ経路に悪意ある挙動を埋め込むことで、セッションをまたいで悪意ある動作を継続させます。これはプロンプト層にはほとんど現れません。

2026年2月の ClawHub インシデントが一例です。OpenClaw エージェントフレームワークのスキルマーケットプレイスである ClawHub を監査した研究者は、2,857件の登録スキルのうち341件が悪意あるスキルであり、その大半が ClawHavoc に遡ることを発見しました。これらのスキルは、Google Workspace コネクタ、仮想通貨トラッカー、YouTube 要約ツールなど、一見普通の連携機能になりすまし、SKILL.md ファイル内に悪意ある指示を隠蔽していました。AIエージェント自身を「信頼された仲介者」として利用し、ユーザに確認を求めることなく偽のCLIツールをインストールさせていました。macOS では、この攻撃チェーンを通じて Atomic Stealer(AMOS)(月額約500〜1,000米ドル(英語)で提供されているサービス型マルウェア)が配信されていました。

Hugging Face にも同様の問題が存在します。Pillar Security の調査(英語)によると、汚染された GGUF(GPT-Generated Unified Format)チャットテンプレートにより、推論時に悪意ある指示をモデルデータ内に埋め込むことが可能であり、ファイル内容のスキャナでは検知できないことが示されました。「毒」が正規のワークフローを通じて侵入するため、防御側にはファイルやシグネチャのスキャンを超えた検知能力、すなわちモデルの入出力(I/O)の振る舞い監視やサプライチェーンの継続的な整合性チェックが必要です。

エンドポイントへの到達:EvilAI

EvilAI に関する研究(英語)は、エンドポイントにおけるリスクを示しています。攻撃者は「AI」と銘打たれたソフトウェアに対する信頼を悪用しました。EvilAI の運営者は、機能的で正当なAI生産性向上ツールに見せかけたマルウェアを配布しており、中には有効なデジタル署名を持つものすらありました。一度インストールされると、ブラウザの認証情報を窃取し、セキュリティソフトを列挙して無効化を試み、C&C(コマンド&コントロール)サーバとAES暗号化通信を維持します。

有効な署名とそれらしいAI機能さえあれば、ユーザの警戒心だけでなく従来のアンチウイルスソフトをもすり抜けてしまいます。だからこそ、署名やブランド名だけに頼るのではなく、アプリケーションが実際に何を行っているかを検知する「振る舞い検知」が極めて重要になります。

セキュリティ対策とベストプラクティス

企業はプロンプトインジェクションを1つのパッチで根絶することはできませんが、攻撃が成功した際の影響を抑え込むことは可能です。防御の考え方を「悪意あるプロンプトをすべて防ぐ」ことから、「一部はすり抜けることを前提とし、侵害されたモデルやエージェントが実行できる権限を制限する」ことへとシフトする必要があります。

  • 最小権限の原則の適用: 例えば、支払いAPIを呼び出せない(権限を持たない)エージェントや、特権ツールを操作できないエージェントであれば、騙されてそれらを悪用される心配はありません。
  • アクション実行前の出力検証: 下流のシステムがモデルの出力を実行・処理する前に、すべてのモデル出力を「信頼できない入力」として検証します。
  • 高リスクまたは不可逆なアクションに対する人間による承認(HITL: Human-in-the-Loop): 取り消しのつかない重要なアクションは、事前に人間が明示的に承認・サインオフすることを必須とします。
  • モデルのサプライチェーン全体における来歴と完全性の確保: 単一のスキャナを過信せず、発行者、ハッシュ値、依存関係を含めて読み込むものを署名・検証します。
  • モデル入出力(I/O)の振る舞い監視の実装: 原因となったプロンプトを検知しようとするだけでなく、異常なツール呼び出し、データへの不正アクセス、外部への不審な送信挙動など、下流への影響を監視します。

この多層防御アプローチは、AI対応システムにおける敵対的行動と対策を体系化した MITRE ATLAS™(英語) とも合致しています。これにより、単一ベンダーの修正パッチを待つことなく、自社で適用可能なセキュリティ統制を確立できます。

今すぐ実践できるベストプラクティスの一つは、ツールへのアクセス権を持つすべてのモデルやエージェントを洗い出し、権限を業務に必要な最小限に絞り込むことです。これにより、インジェクション攻撃が成功した場合でも、特権行使への道筋を断ち、影響を限定的な範囲に封じ込めることができます。

新たな攻撃手法:ハイテク、メディア、通信業界における動向

テクノロジー業界:信頼されたツール内部の新たなアタックサーフェス

  • ツール汚染(MCP): MCPツールの説明文やメタデータ内に指示を潜ませる手口。UI上では見えませんが、モデルはそれを読み取って指示に従ってしまいます。これは2025年4月に Cursor に対して初めて実証(英語)され、Microsoft も2026年にかけてエンタープライズエージェントに対するMCPツール汚染の増加を報告(英語)しています。
  • Slopsquatting(スロップスクワッティング): 2025年の研究(英語)によると、コーディングアシスタントがプロンプトの約20%で同一の存在しないパッケージ名をハルシネーション(幻覚)することが示されました。さらに、同一プロンプトを再実行した場合、それらの架空パッケージ名の43%が毎回繰り返し生成されました。攻撃者はその予測可能な名前を npm や PyPI に事前登録しておくことで、AIが「親切に」勧めるインストール手順そのものをマルウェアの配信経路に仕立て上げることができます。
  • エージェントメモリの汚染: 間接的インジェクションは、その場の回答を誤らせるだけでなく、エージェントの永続メモリに誤った信念を植え付け、セッション終了後も維持させることができます。後からユーザが質問しても、エージェントはそれを事実として頑なに主張します(いわゆる「スリーパーエージェント(英語)」問題)。

メディア・エンターテインメント業界:音声・映像パイプライン内の攻撃

  • 音声プロンプトインジェクション: 音楽、動画、環境音の中に人間には聞き取れないレベルで指示を隠し、音声AIやマルチモーダルAIを乗っ取る手口。研究者らは2026年5月、IEEE Symposium on Security and Privacy で発表された「AudioHijack(英語)」フレームワークを用いて、Microsoft Copilot に対する攻撃を実証(英語)しました。デモでは、単一のMP3ファイルがチャットボットに対してメールの転送やカレンダー予定の削除を命令しました。音声や動画を取り込んで文字起こしを行うパイプラインはすべてこのリスクを継承します。
  • 音声クローンのコモディティ化(低コスト化): サービス型ディープフェイク(英語)の登場により、なりすましのコストと労力が劇的に下がり、脅威が大規模化しています。個別の詐欺リスクにとどまらず、「その声が本物かどうか」という信頼そのものを損なわせます。
  • サイレントモデルドリフト: パイプライン汚染のメカニズム(英語)は、レコメンデーションやコンテンツモデレーションのモデルにも直接当てはまります。訓練データやモデルハブの成果物を汚染することで、プロンプト層に異常を現すことなく、モデルが誤ったコンテンツを表示したり見逃したりするようになります。

通信・コミュニケーション業界:音声チャネルとネットワーク自動化の交差点

  • サポート窓口を通じた音声インジェクション: 音声プロンプトインジェクションは、IVR(自動音声応答)やボイスボットに対しても有効です。発信者の声、保留音ファイル、挿入された音声クリップを通じて、ボイスボットに不正なコマンドを実行させることができます。
  • ネットワーク自動化における過剰な自律権: OWASPの「過剰な自律権(Excessive Agency)(英語)」リスクでは、エージェントがRAN(無線アクセスネットワーク)などのコアネットワーク要素を再構成する恒常的な権限を持っているケースが該当します。インジェクションが成功した場合、単なるデータ漏洩だけでなく、ネットワーク機器の物理的な設定変更や不正操作が実行されてしまいます。
  • OSS/BSS に対するツール汚染: MCPツール汚染の手法は、プロビジョニング、課金、ネットワーク構成インフラに対しても悪用される可能性があります。

TrendAI Vision One™ AI Security は、AIライフサイクル全体を網羅するエンドツーエンドの保護を提供します。AIの攻撃対象領域を可視化し、導入前にモデルやAPIをテストし、ランタイムでの入出力を監視してプロンプトインジェクションやデータ持ち出しなどのAI固有の攻撃パターンを遮断します。AIワークロードにおいて95%以上の脅威検知率を誇り、リアルタイムのプロンプト検査を通じて98%以上のプロンプトインジェクション試行をブロックし、一元化されたポリシー適用によってAIインフラ全体の可視性を提供します。

参考記事:

When Trust in AI Becomes an Attack Surface: Analyzing Prompt Injection, Model Theft, and Pipeline Poisoning

By: Vladimir Kropotov, Myla Pilao

翻訳:与那城 務(Platform Marketing, TrendAI™ Research)