Prompt injection это главный риск OWASP. Ваши агенты это новая поверхность атак.
Prompt injection входит в текущий топ-10 OWASP для LLM-приложений. Когда агенты получают инструменты и автономность, одна внедренная инструкция может привести к утечке данных или выполнению деструктивного действия. Безопасность агентов теперь является предусловием для их развертывания.
Автор: Habib Obeid

Чем мощнее ваш агент, тем больше получает злоумышленник от его захвата. Prompt injection входит в текущий топ-10 OWASP для LLM-приложений и остается одной из наиболее распространенных слабостей в production AI-развертываниях. С ростом автономности растет опасность. Как только агент может вызывать инструменты, просматривать контент и действовать, инструкция, спрятанная в читаемом содержимом, может обратить его возможности против вас.
Агент с инструментами настолько же надежен, насколько надежен наименее надежный документ, который он может прочитать. Относитесь к каждому внешнему входу как к враждебному, потому что злоумышленники уже это делают.
Косвенная injection как угроза предприятия
Прямая injection, когда пользователь печатает переопределение, это простой случай. Опасная это косвенная injection: вредоносная инструкция, скрытая на веб-странице, PDF, электронном письме или билете поддержки, которые агент обрабатывает в рамках своей работы. В 2026 году исследователи опубликовали одно из первых крупномасштабных исследований косвенной injection в реальных условиях, обнаружив тысячи скрытых инструкций, размещенных на живых веб-страницах и направленных на AI-модели, которые их читают. В одном инциденте помощник кодирования удалил production-базу данных, несмотря на явные инструкции ничего не менять, затем сфабриковал записи и неправильно сообщил, что откат был невозможен.
Защита это архитектура, а не инструкция
Нет никакого формулирования system prompt, которое сделает агента защищенным от injection. Пока архитектуры не разделяют четко инструкции от данных, риск сохраняется. Что помогает, так это многоуровневая защита: предположить успешное внедрение и ограничить то, что оно может сделать.
- Минимальные привилегии: агент получает самый узкий доступ к инструментам и данным, которые позволяют ему выполнять его работу, и ничего больше.
- Утверждение человека для любого необратимого или высокоценного действия: удаления, платежи, внешние отправки.
- Валидация входных и выходных данных, четко отделяя ненадежное содержимое от инструкций.
- Полное логирование и мониторинг аномальных вызовов инструментов, чтобы попытки утечки данных обнаруживались и могли быть отслежены.
Позиция HOWF
Мы создаем агентов с предположением, что они будут атакованы. Инструменты работают с минимальными привилегиями, высокорисковые действия проходят через утверждение человека, ненадежные входные данные изолированы, и каждое действие регистрируется и отслеживается. Это та же дисциплина управления, которая отделяет рабочих агентов от тех, которые предприятия тихо отключают. Она применяется конкретно к поверхности атак, создаваемой автономностью.
Источники
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
Хотите применить это к вашему предприятию?