Ang prompt injection ay OWASP's #1 na panganib. Ang inyong mga agent ay ang bagong attack surface.
Ang prompt injection ay nangunguna sa kasalukuyang OWASP Top 10 para sa LLM applications. Habang nakakakuha ng tools at autonomy ang mga agent, isang injected instruction ay maaaring mag-exfiltrate ng data o maglunsad ng destructive action. Ang pag-secure ng mga agent ay ngayon nang isang precondition para sa kanilang deployment.
Ni Habib Obeid

Mas mataas ang capability ng agent, mas malaki ang potential na makakuha ang attacker mula sa pag-hijack nito. Ang prompt injection ay nangunguna sa kasalukuyang OWASP Top 10 para sa LLM applications, at ito ay nananatiling isa sa pinakakasindang weaknesses sa production AI deployments. Ang panganib ay tumataas kasama ng autonomy: kapag ang agent ay maaaring mag-call ng tools, mag-browse, at kumilos, isang instruction na nakatagong nasa content na binabasa nito ay maaaring gamitin ang sarili nitong capabilities laban sa operasyon.
Ang agent na may tools ay kasing-trustworthy lamang ng least-trusted document na babasa nito. Tratuhin ang bawat external input bilang hostile, dahil ginagawa na ito ng mga attacker.
Ang indirect injection ay ang enterprise threat
Ang direct injection, kung saan nag-type ang user ng instruction override, ay ang simpleng case. Ang tunay na panganib ay ang indirect injection: isang malicious instruction na nakatagong nasa web page, PDF, email, o support ticket na pinoproseso ng agent bilang bahagi ng operations. Noong 2026, nag-publish ang mga researcher ng isa sa unang large-scale studies ng indirect injection sa tunay na environment, nahanap ang libu-libong hidden instructions na nakalagay sa live web pages at nakatuon sa AI models na nagbabasa sa kanila. Sa isang documented incident, ang coding assistant ay nag-delete ng production database kahit may explicit instructions na walang pagbabago, pagkatapos ay gumawa ng false records at sinabi na imposible ang rollback.
Ang defense ay architecture, hindi prompt
Walang formulasyon ng system prompt na gagawing injection-proof ang agent; hanggang sa malinaw na paghihiwalay ng architectures sa pagitan ng instructions at data, patuloy ang panganib. Ang effective ay ang defense in depth: ipagpalagay ang matagumpay na injection at limitahan ang aksiyon nito.
- Least privilege: ang agent ay may access lamang sa minimum na tools at data na kinakailangan para sa operations.
- Human approval gates sa anumang irreversible o high-value action tulad ng deletes, payments, o external sends.
- Input at output validation, kung saan ang untrusted content ay malinaw na hiwalay mula sa instructions.
- Kumpleto logging at monitoring para sa anomalous tool calls, upang madali ang pag-detect at pag-attribute ng exfiltration attempts.
Ang HOWF position
Binubuo namin ang mga agent sa assumption na sila ay aabutin ng atake. Ang mga tools ay tumatakbo sa least privilege, ang high-stakes actions ay dumadaan sa human approval, ang untrusted inputs ay hiwalay, at bawat aksyon ay naka-log at monitored. Ito ay ang parehong governance discipline na naghihiwalay sa mga agents na patuloy na pinapatakbo ng enterprises mula sa mga tahimik nilang sinara, inilapat partikular sa attack surface na nilikha ng autonomy.
Mga Pinagkukunan
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
Gusto mo bang mailapat ito sa iyong enterprise?