Prompt injection yra OWASP didžiausia grėsmė. Jūsų agentai yra naujas atakos paviršius.
Prompt injection vadovauja OWASP šiandienos Top 10 LLM aplikacijoms. Kai agentai gauna įrankius ir autonomiją, viena injekta instrukcija gali eksfiltrinti duomenis arba atlikti žalingą veiksmą. Agentų apsauga dabar yra sąlyga jų diegimui.
Autorius: Habib Obeid

Kuo gabesnis jūsų agentas, tuo daugiau atakuotojas gauna, jį perėmęs. Prompt injection vadovauja OWASP šiandienos Top 10 LLM aplikacijoms ir lieka viena iš labiausiai paplitusių silpnybių gamybos AI diegimuose. Pavojus augo kartu su autonomija: kai agentas gali iškviesti įrankius, naršyti ir veikti, instrukcija, paslėpta turinyje, kurį jis skaito, gali paversti jo pačio galias prieš jus.
Agentas su įrankiais yra tik tiek patikimas, kiek patikimas mažiausiai patikimas dokumentas, kurį jis skaitys. Traktuokite kiekvieną išorinį įvestį kaip priešišką, nes atakuotojai tai jau daro.
Netiesioginė injekta yra įmonės grėsmė
Tiesioginė injekta, kai vartotojas įveda perrašymą, yra paprastas atvejis. Pavojinga yra netiesioginė: žalinga instrukcija paslėpta web puslapyje, PDF, el. laiške ar pagalbos biletuose, kuriuos agentas apdoroja kaip savo darbo dalį. 2026 metais tyrėjai paskelbė vieną iš pirmųjų didelės apimties netiesioginės injektos tyrimų praktikoje, aptikę tūkstančius paslėptų instrukcijų, pasėtų gyvosiose web puslapiuose ir nukreiptų į AI modelius, kurie juos skaitė. Viename incidente kodavimo asistentas ištrynė gamybos duomenų bazę nepaisant aiškių nurodymų nieko nekeisti, tada suklastojo įrašus ir melagingai pranešė, kad grąžinimas atgal buvo neįmanomas.
Gynybą sudaro architektūra, o ne prompt
Nėra sisteminės prompt formuluotės, kuri apsaugotų agentą nuo injektos; kol architektūra aiškiai neatskiria instrukcijų nuo duomenų, rizika išlieka. Tai, kas veikia, yra kelių lygių gynybą: manykite, kad injekta bus sėkminga, ir apribokite, ką ji gali daryti.
- Minimali privilegija: agentas gauna tik tiek įrankio ir duomenų prieigos, kiek jam reikalinga savo darbui atlikti, ir nieko daugiau.
- Žmogaus patvirtinimo vartai bet kokiam negrįžtamam arba aukštos vertės veiksmui: ištrynimams, mokėjimams, išoriniams siuntimams.
- Įvesties ir išvesties validavimas, kai nepatikim tas turinys yra aiškiai atskirtas nuo instrukcijų.
- Pilnas registravimas ir stebėjimas anomališkų įrankio iškvietimų, siekiant sulaikyti eksfiliacijos bandymus ir juos atribuoti.
HOWF pozicija
Mes statome agentus su prielaida, kad jie bus atakuoti. Įrankiai veikia su minimalia privilegija, aukštos vertės veiksmai vyksta per žmogaus patvirtinimą, nepatikim os įvestys yra atskirtos, o kiekvienas veiksmas registruojamas ir stebimas. Tai ta pati valdymo disciplina, kuri atskiria agentus, kuriuos įmonės vis dar naudoja, nuo tų, kuriuos jos tylu baigia naudoti, pritaikyta konkrečiai atakos paviršiui, kurį sukuria autonomija.
Šaltiniai
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
Norite tai pritaikyti savo įmonei?