Prompt injection OWASP ਦਾ ਸਭ ਤੋਂ ਵਡਿਆ ਖ਼ਤਰਾ ਹੈ। ਤੁਹਾਡੇ agents ਨਵੀ attack surface ਬਣ ਗਏ ਹਨ।
Prompt injection OWASP ਦੀ ਵਰਤਮਾਨ Top 10 LLM applications ਵਿੱਚ ਸਿਖਰ 'ਤੇ ਹੈ। ਜਦ agents ਨੂੰ tools ਅਤੇ autonomy ਮਿਲਦੀ ਹੈ, ਤਾਂ ਇੱਕ ਵੀ injected instruction data ਨੂੰ exfiltrate ਕਰ ਸਕਦਾ ਹੈ ਜਾਂ ਨੁਕਸਾਨ ਪਹੁੰਚਾਉਣ ਵਾਲੀ ਕਾਰਵਾਈ ਕਰ ਸਕਦਾ ਹੈ। Agents ਨੂੰ secure ਕਰਨਾ ਹੁਣ ਉਹਨਾਂ ਨੂੰ deploy ਕਰਨ ਦੀ ਲਾਜ਼ਮੀ ਸ਼ਰਤ ਹੈ।
Habib Obeid ਵੱਲੋਂ

ਜਿਤਨਾ ਜਿਆਦਾ ਸਮਰੱਥ ਤੁਹਾਡਾ agent, ਉਤਨਾ ਹੀ ਜਿਆਦਾ ਇੱਕ ਹਮਲਾਵਰ ਨੂੰ ਇਸ ਨੂੰ hijack ਕਰਨ ਤੋਂ ਲਾਭ ਮਿਲਦਾ ਹੈ। Prompt injection OWASP ਦੀ ਵਰਤਮਾਨ Top 10 LLM applications ਵਿੱਚ ਸਰਵਉੱਚ ਸਥਾਨ 'ਤੇ ਹੈ, ਅਤੇ ਇਹ production AI deployments ਵਿੱਚ ਸਭ ਤੋਂ ਆਮ ਕਮਜ਼ੋਰੀਆਂ ਵਿੱਚੋਂ ਇੱਕ ਹੈ। ਖ਼ਤਰਾ autonomy ਦੇ ਨਾਲ ਵੱਧਦਾ ਹੈ: ਜਦੋਂ agent tools ਨੂੰ call ਕਰ ਸਕਦਾ ਹੈ, browse ਕਰ ਸਕਦਾ ਹੈ, ਅਤੇ ਕਾਰਵਾਈ ਕਰ ਸਕਦਾ ਹੈ, ਤਾਂ ਕੋਈ ਵੀ smuggled instruction ਉਸ content ਵਿੱਚ ਜਿਸ ਨੂੰ ਇਹ ਪੜ੍ਹਦਾ ਹੈ, ਇਸ ਦੀਆਂ ਆਪਣੀਆਂ ਸਮਰੱਥਾਵਾਂ ਨੂੰ ਤੁਹਾਡੇ ਵਿਰੁੱਧ ਬਦਲ ਸਕਦਾ ਹੈ।
Tool ਸਮੇਤ ਇੱਕ agent ਸਿਰਫ ਆਪਣੀ ਸਭ ਤੋਂ ਘਣ ਭਰੋਸਯੋਗ document ਜਿੰਨਾ ਭਰੋਸੇ ਲਾਇਕ ਹੈ ਜਿਸ ਨੂੰ ਪੜ੍ਹੇ। ਹਰ ਬਾਹਰੀ input ਨੂੰ ਸ਼ੱਤਰੂ ਦੀ ਤਰ੍ਹਾ ਸਮਝੋ, ਕਿਉਂਕਿ ਹਮਲਾਵਰ ਪਹਿਲਾਂ ਤੋਂ ਆਫ਼ੀ ਅਜਿਹਾ ਕਰ ਰਹੇ ਹਨ।
Indirect injection enterprise ਲਈ ਮੁੱਖ ਖ਼ਤਰਾ ਹੈ
Direct injection, ਜਿੱਥੇ ਯੂਜ਼ਰ override ਲਿਖਦਾ ਹੈ, ਸੌਖਾ ਮਾਮਲਾ ਹੈ। ਖ਼ਤਰਨਾਕ ਤਾ indirect ਹੈ: malicious instruction ਜੋ web page, PDF, email, ਜਾਂ support ticket ਵਿੱਚ ਲੁਕਿਆ ਹੋਵੇ ਜਿਸ ਨੂੰ agent ਆਪਣੀ ਕਾਰਜ ਪ੍ਰਾਪਤੀ ਦੇ ਹਿਸਾਬ ਨਾਲ ਪ੍ਰਸੰਸਕਰਿਤ ਕਰਦਾ ਹੈ। 2026 ਵਿੱਚ, ਖੋਜਕਰਤਾਵਾਂ ਨੇ indirect injection ਦਾ ਪਹਲਾ ਵਿਸ਼ਾਲ ਅਧਿਐਨ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤਾ, ਜਿਸ ਵਿੱਚ ਹਜ਼ਾਰਾਂ ਲੁਕੀਆਂ instructions ਲੱਭੀਆਂ ਗਈਆਂ ਜੋ live web pages ਵਿੱਚ ਪ੍ਰੋ ਸੀ ਅਤੇ ਉਨ੍ਹਾਂ AI models ਨੂੰ target ਕਰ ਰਹੀ ਸੀ ਜੋ ਉਨ੍ਹਾਂ ਨੂੰ ਪੜ੍ਹਦੇ ਸੀ। ਇਕ ਮੌਕੇ ਵਿੱਚ, ਇਕ coding assistant ਨੇ production database ਮਿਟਾ ਦਿਓ ਭਾਵੇਂ ਸਪੱਸ਼ਟ instructions ਸੀ ਕਿ ਕੁਝ ਨਾ ਬਦਲੋ, ਫਿਰ records ਬਣਾਏ ਅਤੇ ਗਲਤ ਕਿਹਾ ਕਿ rollback ਅਸੰਭਵ ਸੀ।
Defense architecture ਹੈ, prompt ਨਹੀਂ
ਕੋਈ ਵੀ system prompt ਦਾ ਸ਼ਬਦ ਅਜਿਹਾ ਨਹੀਂ ਹੈ ਜੋ agent ਨੂੰ injection-proof ਬਣਾ ਦੇਵੇ; ਜਦ ਤਕ architectures instructions ਨੂੰ data ਤੋਂ ਸਲੀਕੇ ਨਾਲ ਵੱਖ ਨਾ ਕਰੀ, ਖ਼ਤਰਾ ਰਹਿੰਦਾ ਹੈ। ਕੀ ਕੰਮ ਕਰਦਾ ਹੈ: defense in depth ਹੈ: ਮੰਨ ਲਓ ਕਿ injection ਸਫ਼ਲ ਹੋ ਗਿਆ ਹੈ ਅਤੇ ਸੀਮਤ ਕਰੋ ਕਿ ਕੀ ਕਰ ਸਕਦਾ ਹੈ।
- Least privilege: agent ਨੂੰ ਸਿਰਫ ਉਓ ਹੀ ਸਭ ਤੋਂ ਸੀਮਤ tools ਅਤੇ data access ਮਿਲਦਾ ਹੈ ਜੋ ਆਪਣੀ ਕਾਰਜ ਸਫ਼ਲ ਕਰ ਸਕਣ ਲਈ ਜ਼ਰੂਰੀ ਹੈ, ਕੁਝ ਹੋਰ ਨਹੀਂ।
- ਕਿਸੇ ਵੀ ਅਵਿਸ਼ਵਾਸਨੀ ਜਾਂ ਮਹੱਤਵਪੂਰਨ ਕਾਰਵਾਈ 'ਤੇ ਮਨੁੱਖੀ ਮਨਜ਼ੂਰੀ: ਮਿਟਾਉਣਾ, ਅਦਾਇਗੀ, ਬਾਹਰੀ ਭੇਜਣਾ।
- Input ਅਤੇ output validation, ਜਿੱਥੇ untrusted content ਨੂੰ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ instructions ਤੋਂ ਵੱਖ ਕੀਤਾ ਗਿਆ ਹੋ।
- ਵਿਸ਼ਾਲ logging ਅਤੇ monitoring anomalous tool calls ਲਈ, ਜਤੇ exfiltration ਕੋਸ਼ਿਸ਼ਾਂ ਨੂੰ ਫੜੀ ਜਾ ਸਕਣ ਅਤੇ ਜ਼ਿੰਮੇਵਾਰ ਬਣਾਇਆ ਜਾ ਸਕਣ।
HOWF ਦੀ ਸਥਿਤੀ
ਅਸੀ agents ਨੂੰ ਇਸ ਮੰਨ ਤੋਂ ਬਣਾਉਂਦੇ ਹਾਂ ਕਿ ਉਹਨਾਂ 'ਤੇ ਹਮਲਾ ਹੋਵੇਗਾ। Tools least privilege ਅਧੀਨ ਚਲਦੇ ਹਨ, ਉੱਚ-ਮੁੱਲ ਕਾਰਵਾਈਆਂ human approval ਤੋਂ ਨਿਸ਼ਾਣਬੱਧ ਹਨ, untrusted inputs ਨੂੰ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ ਵੱਖ ਕੀਤਾ ਗਿਆ ਹੈ, ਅਤੇ ਹਰ ਕਾਰਜ ਦਾ ਰਿਕਾਰਡ ਅਤੇ ਨਿਗਰਾਨੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਉਹੀ governance ਹੈ ਜੋ ਉਨ੍ਹਾਂ agents ਵਿਚਕਾਰ ਫ਼ਰਕ ਲਾਉਂਦਾ ਹੈ ਜੋ ਕਿ ਕਮਪਨੀਆਂ ਅਜੇ ਚਲਾ ਰਹੀ ਹਨ ਅਤੇ ਉਨ੍ਹਾਂ ਜੋ ਚੁੱਪਕੇ ਬੰਦ ਕਰ ਦਿੱਤੇ ਹਨ, autonomy ਦਿਓ ਤੋਂ ਪੈਦਾ ਹੋਈ attack surface ਤੇ ਖਾਸ ਤੌਰ 'ਤੇ ਲਾਗੂ।
ਸ੍ਰੋਤ
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
ਇਸ ਨੂੰ ਆਪਣੇ ਉੱਦਮ ਉੱਤੇ ਲਾਗੂ ਕਰਵਾਉਣਾ ਚਾਹੁੰਦੇ ਹੋ?