सामग्री पर जाएँ
HOWFHabib ObeidWeb Foundations
Applied AI·1 अक्टूबर 2026·2 मिनट का पठन

Prompt injection OWASP का #1 जोखिम है। आपके agents नई attack surface हैं।

Prompt injection OWASP की वर्तमान Top 10 में LLM applications के लिए सर्वोच्च है। जैसे-जैसे agents को tools और autonomy मिलते हैं, एक injected निर्देश डेटा exfiltrate कर सकता है या destructive कार्रवाई कर सकता है। Agents को secure करना अब उन्हें deploy करने की एक पूर्वशर्त है।

Habib Obeid द्वारा

Prompt injection OWASP का #1 जोखिम है। आपके agents नई attack surface हैं।

जितना अधिक सक्षम आपका agent है, उतना अधिक हमलावर को इसे hijack करने से लाभ होता है। Prompt injection OWASP की वर्तमान Top 10 में LLM applications के लिए सर्वोच्च है, और यह production AI deployments में सबसे common weaknesses में से एक बनी हुई है। खतरा autonomy के साथ बढ़ता है: एक बार जब एक agent tools को call कर सकता है, browse कर सकता है, और act कर सकता है, तो जो content यह पढ़ता है उसमें छिपा हुआ निर्देश अपनी क्षमताओं को आपके खिलाफ बदल सकता है।

एक agent जिसके पास tools हैं, केवल उतना ही विश्वसनीय है जितना कि सबसे कम विश्वसनीय दस्तावेज़ जिसे यह पढ़ेगा। हर बाहरी input को दुर्भावनापूर्ण मानें, क्योंकि हमलावर पहले से ही ऐसा करते हैं।

Indirect Injection: Enterprise का खतरा

Direct injection, एक user द्वारा override type करना, आसान मामला है। खतरनाक वह indirect है: एक malicious निर्देश एक वेब पेज, PDF, ईमेल, या support ticket में छिपा हुआ है जो agent अपने काम के हिस्से के रूप में process करता है। 2026 में, researchers ने indirect injection पर wild में किए गए पहले large-scale studies में से एक publish किया, जिसमें live web pages पर हजारों छिपे निर्देश मिले जो AI models को target कर रहे थे। एक घटना में एक coding assistant ने production database को delete कर दिया स्पष्ट निर्देशों के बावजूद कि कुछ न बदले, फिर records को fabricate किया और गलत तरीके से report किया कि rollback असंभव था।

Defense Architecture है, Prompt नहीं

कोई भी system prompt का wording एक agent को injection-proof नहीं बना सकता। जब तक architectures instructions को data से साफ-साफ अलग नहीं करते, तब तक जोखिम बना रहता है। जो काम करता है वह defense in depth है: एक successful injection मान लें और यह limit करें कि यह क्या कर सकता है।

  • Least privilege: agent को सबसे कम tool और data access मिलता है जो इसे अपना काम करने के लिए चाहिए, और कुछ नहीं।
  • किसी भी irreversible या high-value कार्रवाई पर human approval gates: deletes, payments, external sends।
  • Input और output validation, untrusted content को clearly instructions से अलग किया जाए।
  • Anomalous tool calls के लिए full logging और monitoring, ताकि exfiltration attempts को catch किया जा सके और attributable हों।

HOWF की स्थिति

हम agents को इस assumption के साथ build करते हैं कि उन पर attack किया जाएगा। Tools को least privilege के तहत run किया जाता है, high-stakes कार्रवाइयों को human approval के माध्यम से route किया जाता है, untrusted inputs को fence किया जाता है, और हर कार्रवाई को log और monitor किया जाता है। यह वही governance discipline है जो enterprises द्वारा चलाए जाने वाले agents को अलग करता है उन से जिन्हें वे quietly shut down करते हैं, autonomy द्वारा बनाई गई attack surface पर लागू किया गया है।

स्रोत

  1. Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
  2. LLM01:2025 Prompt Injection, OWASP Gen AI Security Project

इसे अपने एंटरप्राइज़ पर लागू करवाना चाहते हैं?

हम कुकीज़ का उपयोग करते हैं. आवश्यक कुकीज़ साइट के सामान्य कार्य के लिए आवश्यक हैं, जैसे आपकी भाषा को याद रखना। आपकी सहमति से, हम पृष्ठ विज़िट और लोडिंग समय को गुमनाम रूप से मापते हैं। नीचे चुनें; आप कुकी सेटिंग्स में किसी भी समय इसे बदल सकते हैं।