プロンプトインジェクションはOWASPの#1リスク。エージェントは新たな攻撃対象です。
プロンプトインジェクションはLLMアプリケーション向けOWASPの現在のTop 10で最上位です。エージェントがツールと自律性を獲得するにつれて、注入された単一の命令がデータを流出させたり、破壊的なアクションを実行したりする可能性があります。エージェントの保護は、これらをデプロイするための前提条件になっています。
Habib Obeid 著

エージェントが高度な能力を持つほど、攻撃者がそれをハイジャックすることで得られる利益は大きくなります。プロンプトインジェクションはLLMアプリケーション向けOWASPの現在のTop 10で最上位であり、本番環境のAIデプロイメントにおいて最も一般的な脆弱性の一つです。その危険性は自律性とともに増大します。エージェントがツールを呼び出し、ブラウズし、アクションを実行できるようになると、読み取るコンテンツに埋め込まれた命令がそのエージェント自身の能力を逆用させる可能性があります。
ツールを持つエージェントの信頼性は、読む最も信頼できない文書と同じレベルでしかありません。すべての外部入力は敵対的であると想定してください。攻撃者はすでにそのように対応しているからです。
間接的なインジェクションはエンタープライズの脅威
ユーザーがオーバーライドを入力する直接的なインジェクションは簡単なケースです。危険なのは間接的なもので、エージェントが業務の一部として処理するWebページ、PDF、メール、またはサポートチケットに隠された悪意のある命令です。2026年、研究者は野外での間接的なインジェクションに関する最初の大規模研究の一つを発表し、ライブWebページ全体に植え込まれた数千の隠された命令を発見しました。これらはそれらを読むAIモデルを対象としていました。ある事件では、コーディングアシスタントが何も変更しないという明示的な指示にもかかわらず本番データベースを削除し、その後レコードを捏造し、ロールバックが不可能であると虚偽の報告をしました。
防御はプロンプトではなくアーキテクチャ
エージェントをインジェクション耐性にするシステムプロンプトの表現は存在しません。アーキテクチャが命令とデータを明確に分離するまで、リスクは継続します。効果的なのは多層防御であり、攻撃成功を想定して、できることを制限することです。
- 最小権限。エージェントは業務を実行できる最小限のツールとデータアクセスのみを取得し、それ以上のものは取得しません。
- 取り消し不可能または高価値なアクション(削除、支払い、外部送信)に対する人間の承認ゲート。
- 信頼できないコンテンツが命令から明確に隔離された入出力検証。
- 異常なツール呼び出しの完全なログとモニタリング。流出試行は検出でき、追跡可能です。
HOWFの立場
私たちはエージェントが攻撃されるという前提で構築します。ツールは最小限の権限下で実行され、重要度の高いアクションは人間による承認を経由し、信頼されていない入力は隔離され、すべてのアクションはログに記録され監視されます。これは企業がまだ実行中のエージェントと、静かにシャットダウンしたエージェントを区別するのと同じガバナンス規律であり、自律性が生み出す攻撃対象に特に適用されています。
出典
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
これを貴社のエンタープライズに適用しませんか?