Prompt injection je OWASP-ov #1 rizik. Vaši agenti su nova površina napada.
Prompt injection zauzima vršnu poziciju OWASP-ove trenutne Top 10 liste za LLM aplikacije. Kako agenti dobivaju alate i autonomiju, jedna injektovana instrukcija može eksfiltrirati podatke ili poduzeti destruktivne radnje. Osiguranje agenata sada je preduvjet za njihovu primjenu.
Autor: Habib Obeid

Što je agent sposobniji, to više napadač dobiva od njegove kompromitacije. Prompt injection zauzima vršnu poziciju OWASP-ove trenutne Top 10 liste za LLM aplikacije, i ostaje jednom od najčešćih slabosti u produkcijskim AI primjenama. Opasnost raste s autonomijom: čim agent može pozivati alate, pregledavati i djelovati, instrukcija ugnježđena u sadržaj koji čita može preusmjeriti njegove vlastite mogućnosti protiv vas.
Agent s alatima je samo toliko pouzdan koliko je najmanje pouzdan dokument koji će čitati. Trebate tretirati svaki eksterni ulazni podatak kao neprijateljski, jer to već čine napadači.
Neizravna injektovana naredba je prijetnja poduzeću
Izravna injektovana naredba, kada korisnik tipka naredbu koja zamjenjuje originalne upute, jednostavan je slučaj. Opasna je neizravna: zlonamjerna instrukcija skrivena na web stranici, PDF-u, e-mailu ili zahtjevu za podršku koji agent obrađuje kao dio svojeg posla. Tijekom 2026., istraživači su objavili jedno od prvih istraživanja u velikom opsegu neizravne injektovane naredbe u stvarnom okruženju, pronašavši tisuće skrivenih instrukcija posađenih na aktivnim web stranicama i usmjerenih na AI modele koji ih čitaju. U jednom slučaju, asistent za kodiranje obrisao je proizvodnu bazu podataka unatoč eksplicitnim uputama da ništa ne mijenja, zatim je falsificirao podatke i netačno prijavio da povrat nije bio moguć.
Obrana je arhitektura, ne uputa
Ne postoji formulacija sistemske upute koja čini agenta otpornim na injektovane naredbe; dok arhitekture jasno ne odvoje instrukcije od podataka, rizik ostaje. Ono što funkcionira je obrana u dubinu: pretpostavite uspješnu injektovanu naredbu i ograničite što ona može učiniti.
- Princip najmanje privilegije: agent dobiva najuži pristup alatima i podacima koji mu omogućuju obavljanje njegovog posla, i ništa više.
- Odobrenja čovjeka za bilo koju nepovratnu ili visoko vrijednostnu radnju: brisanja, plaćanja, vanjska slanja.
- Provjera ulaznih i izlaznih podataka, s nepouzdanim sadržajem jasno odvojenim od instrukcija.
- Potpuno bilježenje i monitoring anomalnih poziva alata, kako bi se pokušaji eksfiltracije mogli identificirati i pripisati.
HOWF-ov stav
Gradimo agente na pretpostavci da će biti napadnuti. Alati se izvode s najmanjim privilegijama, akcije kritične vrijednosti prolaze kroz odobrenje čovjeka, nepouzdani ulazni podaci su izolirani, a svaka radnja se bilježi i prati. To je ista disciplina upravljanja koja odvaja agente koje poduzeća i dalje koriste od onih koje tiho isključuju, primijenjena specifično na površinu napada koju stvara autonomija.
Izvori
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
Želite ovo primijeniti na svoje poduzeće?