AIエージェントに対するプロンプトインジェクションとは何ですか?一般的なハッキングとどう違いますか?
プロンプトインジェクションはLLMの構造的な特性を利用する。指示とデータの両方が自然言語のテキストとして入力され、モデル自体は「ユーザーが依頼したこと」と「データ処理中にたまたま読んだテキスト」を確実に区別できない。攻撃者はパスワードを解読したりコードの脆弱性を見つけたりする必要はなく、エージェントがいずれ読むコンテンツ——要約するメールや巡回するウェブページなど——に指示を隠すだけで、攻撃者が意図した行動をエージェントに実行させられる可能性がある。
従来のセキュリティ攻撃との最大の違いは、攻撃発生時点で悪意あるコードも、ログイン失敗記録も、アンチウイルスソフトが検知できる兆候もほとんど存在しない点にある。攻撃全体が通常の自然言語テキストとして進行するため、アンチウイルス、ファイアウォール、静的スキャンといった従来のツールでは正常なコンテンツとほぼ区別がつかない。
エージェントに対するプロンプトインジェクションはなぜ起こるのですか?何が原因ですか?
核心的な原因は、エージェントの設計目的そのものが外部コンテンツを読み取り処理することを要求している点にある——外部データに一切触れないエージェントは、実用的価値のほとんどを失ってしまう。エージェントが「非公開データへのアクセス」「信頼できない外部コンテンツへの露出」「外部との通信能力(メール送信、API呼び出し、データベースへの書き込み)」という3つの条件を同時に満たすとき、攻撃経路が成立する。独立研究者のサイモン・ウィリソンは2025年、この組み合わせを「致命的三要素(lethal trifecta)」と名付け、この呼称はその後、ほぼすべての主要なプロンプトインジェクション事件に共通する構造を正確に説明するものとして業界で広く採用された。
もう一つの推進要因は、企業がエージェントをより便利にするため、より広範なデータアクセスとより多くの外部行動権限を付与する傾向にあり、これが攻撃対象領域を直接的に拡大させていることだ。現時点で公表されている最強の防御手法でも、最適化された注入攻撃のおよそ1割を見逃している。
エージェントに対するプロンプトインジェクションは具体的にどのように起こり、攻撃者は実際に何をするのですか?
最も代表的な実例は、2025年半ばにAim Securityが公表したEchoLeak(CVE-2025-32711、CVSSスコア9.3)である。攻撃者は隠し指示を含む1通の巧妙に作成されたメールを標的に送るだけでよく、標的側のクリックや操作は一切不要だった。Microsoft 365 Copilotがこのメールを通常の要約処理の中で読み込んだ際、隠された指示を読み取って実行し、OneDrive、SharePoint、Teamsからデータを抽出した後、信頼されたMicrosoftドメインを経由してデータを外部に流出させた。攻撃全体は自然言語のみで行われ、悪意あるコードは一切関与せず、アンチウイルス、ファイアウォール、静的スキャンはいずれも異常を検知できなかった。マイクロソフトは責任ある開示を受けてサーバー側で修正パッチを適用し、パッチ適用前に実際に悪用された証拠は確認されていない。
この種の攻撃は指示の注入経路によって直接注入と間接注入の2種類に分けられる。直接注入は攻撃者がエージェントに直接悪意ある指示を入力するもの、間接注入(IDPI)はエージェントが自ら読み込む第三者コンテンツ(ウェブページ、データベース、アップロードされた文書)に指示を隠すものである。エージェントは通常の動作中にそのコンテンツを読むだけで侵害され、この間接的な形態が現在、実務上より一般的で防御が難しいものとして観察されている。
エージェントに対するプロンプトインジェクションは私にとってどういう意味があり、どう対応すべきですか?
あなたの組織がデータアクセス権を持つエージェントを導入している、または導入を検討している場合、このリスクはエージェントにどのシステムへの接触を許し、どれだけの自律的な行動範囲を与えるかに直接関わる。研究によれば、エージェントが動かすデータ量は平均的な人間ユーザーの約16倍とされ、これは注入に成功されたエージェント1件が引き起こすデータ流出の規模が、従来型のセキュリティモデルにおける単一アカウント侵害よりもはるかに大きくなりがちであることを意味する。別の調査でも、エージェントを運用する組織の高い割合が過去1年以内に確認済みまたは疑わしいセキュリティインシデントを報告した一方、エージェントセキュリティに割り当てられているセキュリティ予算の比率は依然として低い。
具体的に確認すべき対応としては、自社のエージェントが「致命的三要素」(非公開データへのアクセス、信頼できないコンテンツへの露出、外部通信能力)を同時に備えていないか棚卸しし、3つすべてが揃っている場合は、外部通信チャネルを制限する、または信頼できないコンテンツの処理を独立した低権限エージェントに分離するなど、いずれか一つの連鎖を断ち切ることを優先する。金銭操作、データ削除、外部送信といった高リスクの行動には、人間の確認なしにエージェントが直接実行しないよう、人間による承認を必須とする。
2025年半ば、Aim SecurityはMicrosoft 365 Copilotのゼロクリック型脆弱性を公表。メール1通で攻撃が成立し、CVE-2025-32711(CVSS 9.3)として登録された。マイクロソフトはサーバー側で修正済み。
Restricting an agent's data access and external communication ability directly reduces its prompt-injection attack surface, but also limits its practical usefulness — an agent fully isolated from any external content can barely complete most real tasks. The practical tradeoff usually comes down to which high-risk actions require mandatory human approval, rather than a binary choice of restricting or not. Over-restricting turns the agent into a hollow tool; over-permitting directly inherits the lethal trifecta's risk.