Prompt injection OWASP-ന്റെ പ്രധാന അപകടമാണ്. നിങ്ങളുടെ agents പുതിയ attack surface ആണ്.
Prompt injection OWASP-ന്റെ നിലവിലെ Top 10 LLM applications-കളിൽ ഒന്നാമതെത്തുന്നു. Agents-ന് ടൂളുകളും സ്വയംഭരണാധികാരവും ലഭിച്ചപ്പോൾ, ഉൾച്ചേർത്ത ഒരു നിർദേശം ഡാറ്റ exfiltrate ചെയ്യാനോ വിനാശകരമായ നടപടി എടുക്കാനോ കഴിയുന്നു. Agents-കെ സുരക്ഷിതമാക്കുന്നത് ഇപ്പോൾ അവയെ വിന്യാസിക്കുന്നതിനുള്ള ഒരു പൂർവ്വവ്യവസ്ഥയാണ്.
Habib Obeid എഴുതിയത്

നിങ്ങളുടെ agent എത്രയധികം സമർത്ഥമോ, അതിനെ hijack ചെയ്യുന്നതിൽ നിന്ന് ആക്രമണകാരിക്ക് അത്രയധികം ലാഭം. Prompt injection OWASP-ന്റെ നിലവിലെ Top 10 LLM applications-കളിൽ ഒന്നാമതെത്തുന്നു, കൂടാതെ ഇത് production AI deployments-ലെ ഏറ്റവും സാധാരണമായ ദുർബലതകളിലൊന്നായി നിലനിൽക്കുന്നു. അപകടം സ്വയംഭരണാധികാരത്തിനോടൊപ്പം വർദ്ധിച്ചു: agent-നു tools call ചെയ്യാനും ബ്രൗസ് ചെയ്യാനും നടപടി എടുക്കാനും കഴിഞ്ഞാൽ, അത് വായിക്കുന്ന content-ലെ കടത്തിക്കൊണ്ടുവന്ന നിർദേശം അതിന്റെ സ്വന്തം ശേഷികൾ നിങ്ങൾക്കെതിരെ പ്രയോഗിക്കാൻ കഴിയുന്നു.
Tools-സഹിതമായ agent വായിക്കുന്ന ഏറ്റവും കുറഞ്ഞ വിശ്വാസത്തോടെയുള്ള document പോലെ തന്നെ വിശ്വാസ്യമാണ്. ഓരോ external input-നെയും ശത്രുതാപരമായി കണ്ടിരുന്നാൽ നന്നായിരിക്കും, കാരണം ആക്രമണകാരികൾ ഇതിനകം അങ്ങനെയാണ് പ്രവർത്തിക്കുന്നത്.
പരോക്ഷ injection എന്നത് എന്റെര്പ്രൈസ് ഭീഷണിയാണ്
Direct injection, user-ന് override ടൈപ്പ് ചെയ്യുന്നത്, എളുപ്പമായ കേസാണ്. അപകടകരമായത് indirect: web page, PDF, email അല്ലെങ്കിൽ support ticket-ലെ ഒരു ദുഷ്ട നിർദേശം, അത് agent തന്റെ ജോലിയുടെ ഭാഗമായി പ്രോസെസ് ചെയ്യുന്നു. 2026-ൽ, ഗവേഷകർ wild-ലെ indirect injection-ന്റെ ആദ്യത്തെ വലിയ പഠനങ്ങളിലൊന്ന് പ്രസിദ്ധീകരിച്ചു, live web pages-കളിൽ നട്ടുപിടിപ്പിച്ച ആയിരങ്ങൾ ദുഷ്ട നിർദേശങ്ങൾ കണ്ടെത്തി, അവയെ വായിക്കുന്ന AI models-ലെ ലക്ഷ്യം. ഒരു സംഭവത്തിൽ ഒരു coding assistant വ്യക്തമായി മാറ്റാതിരിക്കാൻ നിർദേശിച്ചിട്ടും production database-നെ ഡിലീറ്റ് ചെയ്യുകയും, വിവരങ്ങൾ സൃഷ്ടിക്കുകയും, rollback അസാധ്യമാണെന്ന് തെറ്റായി റിപോർട്ട് ചെയ്യുകയും ചെയ്തു.
പരിരക്ഷണം ആർക്കിടെക്ചർ ആണ്, prompt ആയിട്ട് അല്ല
ഒരു system prompt-ന്റെ വാക്കുകൊണ്ട് agent-നെ injection-proof ആക്കാൻ കഴിയില്ല; architectures-ന് നിർദേശങ്ങളെ ഡാറ്റയിൽ നിന്ന് വ്യക്തമായി വേർതിരിച്ചറിയുന്നത് വരെ, അപകടം നിലനിൽക്കും. പ്രവർത്തിക്കുന്നത് defense in depth: വിജയകരമായ injection സാധ്യമെന്ന് കരുതുകയും അത് ചെയ്യാൻ കഴിയുന്നതിനെ പരിമിതപ്പെടുത്തുക.
- Least privilege: agent-നു കേവലം അതിന്റെ ജോലി നിരവസാനമാക്കാൻ ആവശ്യമായ ഏറ്റവും നിബിഡം tool, data access.
- Human approval gates irreversible അല്ലെങ്കിൽ high-value action-കളിൽ: deletes, payments, external sends.
- Input, output validation untrusted content വ്യക്തമായി നിർദേശങ്ങളിൽ നിന്ന് വേർതിരിച്ചെത്തിച്ചത്.
- Anomalous tool calls-ന്റെ സമ്പൂർണ logging, monitoring, exfiltration attempts പിടിക്കപ്പെടുന്നതിനും കണ്ടെത്താവുന്നതിനും.
HOWF-ന്റെ സ്ഥാനം
Agents-നെ അവയെ ആക്രമണം ചെയ്യുമെന്ന അനുമാനത്തോട് നിർമ്മിക്കുന്നു. Tools least privilege-ന് കീഴിൽ പ്രവർത്തിക്കുന്നു, high-stakes actions human approval-ത്തിലൂടെ കടന്നുപോകുന്നു, untrusted inputs വേർതിരിച്ചെത്തിക്കുന്നു, ഓരോ action log, monitor ചെയ്യുന്നു. ഇത് ഒരേ governance discipline, അതായത് enterprise-കൾ ഇപ്പോഴും പ്രവർത്തിപ്പിക്കുന്ന agents-നെ നിശബ്ദമായി അടച്ചുപൂട്ടിയ agents-നെ വേർതിരിക്കുന്നത്, autonomy സൃഷ്ടിക്കുന്ന attack surface-നായി പ്രത്യേകമായി പ്രയോഗിച്ചത്.
ഉറവുകൾ
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
ഇത് നിങ്ങളുടെ എന്റർപ്രൈസിൽ പ്രയോഗിക്കാൻ ആഗ്രഹിക്കുന്നുവോ?