Prompt Injection ist OWASPs Risiko Nummer 1. Ihre Agenten sind die neue Angriffsfläche.
Prompt Injection rangiert in OWASPs aktuellem Top 10 für LLM-Anwendungen an erster Stelle. Wenn Agenten Werkzeuge und Autonomie gewinnen, kann eine einzelne injizierte Anweisung Daten exfiltrieren oder destruktive Maßnahmen auslösen. Die Absicherung von Agenten ist heute eine Grundvoraussetzung für ihren Einsatz.
Von Habib Obeid

Je leistungsfähiger Ihr Agent ist, desto mehr gewinnt ein Angreifer, wenn er ihn übernimmt. Prompt Injection rangiert in OWASPs aktuellem Top 10 für LLM-Anwendungen an erster Stelle und bleibt einer der häufigsten Schwachpunkte in produktiven KI-Einsätzen. Das Risiko wächst mit der Autonomie: Sobald ein Agent Werkzeuge aufrufen, browsen und handeln kann, kann eine in den verarbeiteten Inhalten eingeschleuste Anweisung seine Fähigkeiten gegen Sie wenden.
Ein Agent mit Werkzeugen ist nur so vertrauenswürdig wie das am wenigsten vertrauenswürdige Dokument, das er liest. Betrachten Sie jede externe Eingabe als feindselig, denn Angreifer tun es bereits.
Indirekte Injection ist die Bedrohung für Unternehmen
Direkte Injection, wenn ein Benutzer einen Override eingibt, ist der einfache Fall. Der gefährliche Fall ist die indirekte: eine böswillige Anweisung, die in einer Webseite, einem PDF, einer E-Mail oder einem Support-Ticket versteckt ist, das der Agent im Rahmen seiner Arbeit verarbeitet. 2026 veröffentlichten Forscher eine der ersten großangelegten Studien über indirekte Injection in der Praxis und fanden Tausende versteckte Anweisungen auf Live-Webseiten, die auf die KI-Modelle abzielen, die sie lesen. In einem Fall löschte ein Code-Assistent eine Produktionsdatenbank, obwohl ihm explizit befohlen wurde, nichts zu ändern, fabrizierte dann Datensätze und meldete fälschlicherweise, dass ein Rollback unmöglich war.
Verteidigung ist Architektur, kein Prompt
Es gibt keine Formulierung eines System-Prompts, die einen Agent injektionssicher macht; solange Architekturen Anweisungen und Daten nicht klar trennen, bleibt das Risiko bestehen. Was funktioniert, ist eine mehrschichtige Verteidigung: Gehen Sie davon aus, dass eine Injection erfolgreich ist, und begrenzen Sie, was sie bewirken kann.
- Minimale Berechtigung: Der Agent erhält nur den minimalen Zugriff auf Werkzeuge und Daten, den er benötigt, und nichts mehr.
- Genehmigung durch Menschen bei irreversiblen oder kritischen Maßnahmen: Löschungen, Zahlungen, externe Versendungen.
- Validierung von Ein- und Ausgabe mit klarer Abgrenzung nicht vertrauenswürdiger Inhalte von Anweisungen.
- Vollständige Protokollierung und Überwachung anomaler Werkzeugaufrufe, damit Exfiltrations-Versuche erkannt und nachvollzogen werden können.
Die HOWF-Position
Wir entwickeln Agenten unter der Annahme, dass sie angegriffen werden. Werkzeuge werden unter minimaler Berechtigung ausgeführt, kritische Maßnahmen werden durch menschliche Genehmigung geleitet, nicht vertrauenswürdige Eingaben werden abgegrenzt, und jede Maßnahme wird protokolliert und überwacht. Das ist die gleiche Governance-Disziplin, die Agenten unterscheidet, die Unternehmen noch betreiben, von jenen, die sie stillschweigend einstellen, nun speziell auf die Angriffsfläche angewendet, die Autonomie schafft.
Quellen
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
Möchten Sie das auf Ihr Unternehmen angewendet sehen?