Prompt injection हे OWASP चे #1 जोखीम आहे. आपले agents हे नवीन attack surface आहेत.
Prompt injection LLM अनुप्रयोगांसाठी OWASP च्या वर्तमान Top 10 मध्ये शीर्षस्थानी आहे. जसजसे agents ला tools आणि autonomy मिळते, तसतसे एक डाली गेलेली सूचना डेटा निर्यात करू शकते किंवा विनाशकारी कार्य करू शकते. Agents ला सुरक्षित करणे आता त्यांना तैनात करण्याची एक पूर्वशर्त आहे.
Habib Obeid यांच्याद्वारे

आपला agent जितका सक्षम असेल, तितका अधिक हल्लागारला त्याचा अपहरण करून लाभ मिळतो. Prompt injection LLM अनुप्रयोगांसाठी OWASP च्या वर्तमान Top 10 मध्ये शीर्षस्थानी आहे, आणि हे production AI deployments मध्ये सर्वात सामान्य कमजोरीपैकी एक राहते. Autonomy सह धोका वाढतो: एकदा agent ला tools कॉल करता येते, web browse करता येते आणि कार्य करता येते, तर त्याने वाचलेल्या content मध्ये डाली गेलेली सूचना त्याच्या स्वतःच्या क्षमता तुमच्या विरुद्ध वापरू शकते.
Tools सह असलेला agent केवळ त्याने वाचणार्या कमीत कमी विश्वसनीय document तितकाच विश्वसनीय आहे. प्रत्येक बाह्य input ला शत्रुतापूर्ण समजा, कारण हल्लागार आधीच असे करत आहेत.
अप्रत्यक्ष injection हे enterprise चे धोका आहे
Direct injection, वापरकर्ता एक override टाइप करणे, हे सोपे प्रकरण आहे. धोकादायक अप्रत्यक्ष injection आहे, जेथे एक दुर्भावनापूर्ण सूचना एक web page, PDF, email, किंवा support ticket मध्ये लपलेली असते जी agent त्याच्या काम च्या भागरूप process करते. 2026 मध्ये, संशोधकांनी अप्रत्यक्ष injection च्या पहिल्या मोठ्या प्रमाणातील अभ्यासांपैकी एक प्रकाशित केला, ज्यामध्ये हजारो लपलेल्या सूचना live web pages मध्ये रोपल्या गेल्या आणि त्यांना वाचणार्या AI models ला निर्देशित केल्या गेल्या. एक घटनेमध्ये, एक coding assistant ने स्पष्ट सूचनांच्या विरुद्ध production database हटवून दिला, नंतर records बनवून घेतले आणि चुकीचे अहवाल दिले की rollback अशक्य आहे.
Defense हे architecture आहे, prompt नाही
System prompt च्या कोणत्याही शब्दांचा असा निरूपण नाही जो agent ला injection-proof बनवतो. जोपर्यंत architectures instructions आणि data यांना स्पष्टपणे विभक्त करत नाहीत, तोपर्यंत जोखीम राहते. Defense in depth हे काम करते: यशस्वी injection झाल्याचे गृहीत धरा आणि ते काय करू शकते हे मर्यादित करा.
- Least privilege: agent ला सर्वकनीसतम tool आणि data access मिळते जे त्याला त्याचे काम करू देते, आणि काही नाही.
- कोणत्याही irreversible किंवा high-value action वर human approval gates: deletes, payments, external sends.
- Input आणि output validation, untrusted content स्पष्टपणे instructions पासून अलग केले जाते.
- Anomalous tool calls साठी पूर्ण logging आणि monitoring, जेणेकरून exfiltration attempts पकडले जात आणि जिम्मेदारी ठरवता येते.
HOWF स्थिती
आम्ही agents ला हल्ले होतील असा गृहीत धरून तयार करतो. Tools least privilege अंतर्गत चालतात, high-stakes actions human approval मार्गे जातात, untrusted inputs अलग केल्या जातात, आणि प्रत्येक action logged आणि monitored आहे. हे तेच governance discipline आहे जे enterprises अजूनही चलवत असलेल्या agents ला त्यांच्या मधून अलग करते जे ते शांतीने बंद करतात, autonomy ने तयार केलेल्या attack surface साठी विशेषतः लागू केले.
स्रोत
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
हे तुमच्या एंटरप्राइझला लागू करू इच्छिता?