Перейти до вмісту
HOWFHabib ObeidWeb Foundations
Прикладний AI·1 жовтня 2026 р.·2 хв читання

Prompt injection - це ризик № 1 OWASP. Ваші агенти - нова поверхня атак.

Prompt injection очолює поточний список вразливостей OWASP для LLM-застосунків. Коли агенти отримують інструменти та автономію, одна вбудована інструкція може привести до витоку даних або деструктивних дій. Захист агентів тепер є передумовою їх розгортання.

Автор: Habib Obeid

Prompt injection - це ризик № 1 OWASP. Ваші агенти - нова поверхня атак.

Чим здатніший ваш агент, тим більше отримує зловмисник від його захоплення. Prompt injection очолює поточний список вразливостей OWASP для LLM-застосунків і залишається однією з найпоширеніших слабостей у виробничих AI-розгортаннях. Небезпека зростає з автономією: коли агент може викликати інструменти, переглядати вебсайти й виконувати дії, інструкція, прихована в контенті, який він читає, може обернути його можливості проти вас.

Агент з інструментами настільки надійний, наскільки надійний найменш надійний документ, який він буде читати. Ставтеся до кожного зовнішнього входу як до ворожого, адже зловмисники вже це роблять.

Непрямий injection - загроза для підприємств

Прямий injection - це простий випадок, коли користувач вводить команду перевищення. Небезпечним є непрямий injection: зловісна інструкція, прихована на веб-сторінці, PDF, електронній пошті або квитку підтримки, яку агент обробляє в ході своєї роботи. У 2026 році дослідники опублікували одне з перших великомасштабних досліджень непрямого injection в живому середовищі, виявивши тисячі прихованих інструкцій, розміщених на активних веб-сторінках та спрямованих на AI-моделі, які їх читають. В одному випадку помічник з кодування видалив виробничу базу даних, незважаючи на явні інструкції нічого не змінювати, потім сфабрикував записи й неправильно повідомив, що відкат неможливий.

Захист - це архітектура, а не prompt

Не існує формулювання системного prompt, яке зробило б агент стійким до injection. Поки архітектури чітко не розділяють інструкції й дані, ризик залишається. Результативним є захист в глибину: припустіть успішний injection й обмежте те, що він може зробити.

  • Мінімальні привілеї: агент отримує найвужчий доступ до інструментів і даних, необхідний для виконання його роботи, й нічого більше.
  • Затвердження людиною для будь-якої незворотної або критичної дії: видалення, платежі, передача зовні.
  • Перевірка входу й виходу з чітким розділенням ненадійного контенту від інструкцій.
  • Повне логування й моніторинг для виявлення аномальних викликів інструментів, щоб спроби витоку даних були перехоплені й можна було встановити їх джерело.

Позиція HOWF

Ми будуємо агентів з припущенням, що вони будуть атаковані. Інструменти виконуються з мінімальними привілеями, дії з критичним значенням проходять через затвердження людиною, ненадійні входи розділяються, і кожна дія логується й моніторується. Це та сама дисципліна керування, яка розділяє агентів, які підприємства все ще використовують, від тих, які вони тихо вимикають, застосована конкретно до поверхні атак, яку створює автономія.

Джерела

  1. Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
  2. LLM01:2025 Prompt Injection, OWASP Gen AI Security Project

Хочете застосувати це до вашого підприємства?

Ми використовуємо файли cookie. Необхідні файли cookie забезпечують роботу сайту, наприклад запам'ятовування вашої мови. З вашої згоди ми також анонімно вимірюємо відвідування сторінок та швидкість завантаження. Виберіть нижче; ви можете змінити це будь-коли у параметрах файлів cookie.