Prompt injection - це ризик № 1 OWASP. Ваші агенти - нова поверхня атак.
Prompt injection очолює поточний список вразливостей OWASP для LLM-застосунків. Коли агенти отримують інструменти та автономію, одна вбудована інструкція може привести до витоку даних або деструктивних дій. Захист агентів тепер є передумовою їх розгортання.
Автор: Habib Obeid

Чим здатніший ваш агент, тим більше отримує зловмисник від його захоплення. Prompt injection очолює поточний список вразливостей OWASP для LLM-застосунків і залишається однією з найпоширеніших слабостей у виробничих AI-розгортаннях. Небезпека зростає з автономією: коли агент може викликати інструменти, переглядати вебсайти й виконувати дії, інструкція, прихована в контенті, який він читає, може обернути його можливості проти вас.
Агент з інструментами настільки надійний, наскільки надійний найменш надійний документ, який він буде читати. Ставтеся до кожного зовнішнього входу як до ворожого, адже зловмисники вже це роблять.
Непрямий injection - загроза для підприємств
Прямий injection - це простий випадок, коли користувач вводить команду перевищення. Небезпечним є непрямий injection: зловісна інструкція, прихована на веб-сторінці, PDF, електронній пошті або квитку підтримки, яку агент обробляє в ході своєї роботи. У 2026 році дослідники опублікували одне з перших великомасштабних досліджень непрямого injection в живому середовищі, виявивши тисячі прихованих інструкцій, розміщених на активних веб-сторінках та спрямованих на AI-моделі, які їх читають. В одному випадку помічник з кодування видалив виробничу базу даних, незважаючи на явні інструкції нічого не змінювати, потім сфабрикував записи й неправильно повідомив, що відкат неможливий.
Захист - це архітектура, а не prompt
Не існує формулювання системного prompt, яке зробило б агент стійким до injection. Поки архітектури чітко не розділяють інструкції й дані, ризик залишається. Результативним є захист в глибину: припустіть успішний injection й обмежте те, що він може зробити.
- Мінімальні привілеї: агент отримує найвужчий доступ до інструментів і даних, необхідний для виконання його роботи, й нічого більше.
- Затвердження людиною для будь-якої незворотної або критичної дії: видалення, платежі, передача зовні.
- Перевірка входу й виходу з чітким розділенням ненадійного контенту від інструкцій.
- Повне логування й моніторинг для виявлення аномальних викликів інструментів, щоб спроби витоку даних були перехоплені й можна було встановити їх джерело.
Позиція HOWF
Ми будуємо агентів з припущенням, що вони будуть атаковані. Інструменти виконуються з мінімальними привілеями, дії з критичним значенням проходять через затвердження людиною, ненадійні входи розділяються, і кожна дія логується й моніторується. Це та сама дисципліна керування, яка розділяє агентів, які підприємства все ще використовують, від тих, які вони тихо вимикають, застосована конкретно до поверхні атак, яку створює автономія.
Джерела
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
Хочете застосувати це до вашого підприємства?