Prompt injection היא הסיכון #1 של OWASP. הסוכנים שלך הם משטח ההתקפה החדש.
Prompt injection עומדת בראש ה-Top 10 הנוכחי של OWASP עבור יישומי LLM. כאשר סוכנים רוכשים כלים ועצמאות, הוראה מוזרקת בודדת יכולה להוביל לניקוז נתונים או לביצוע פעולה הרסנית. הבטחת סוכנים היא כעת תנאי מוקדם לפריסתם.
מאת Habib Obeid

כל שהסוכן שלך יותר מסוגל, כך גם יותר מה שתוקף מרוויח מהשתלטות עליו. Prompt injection עומדת בראש ה-Top 10 הנוכחי של OWASP עבור יישומי LLM, והיא נותרה אחת מההחלשות הנפוצות ביותר בפריסות AI בייצור. הסכנה גדלה עם העצמאות: ברגע שסוכן יכול לקרוא לכלים, לגלוש ולפעול, הוראה מוזרקת בתוך התוכן שהוא קורא יכולה להפוך את יכולותיו שלו נגדך.
סוכן עם כלים הוא אמין רק עד כמו המסמך הפחות אמין שהוא יקרא. התייחס לכל קלט חיצוני כאל אויב, כי התוקפים כבר עושים כן.
הזרקה עקיפה היא איום הארגון
הזרקה ישירה, משתמש המקליד ביטול, היא המקרה הקל. המסוכנת היא הזרקה עקיפה: הוראה זדונית מוסתרת בעמוד אינטרנט, PDF, דוא"ל או כרטיס תמיכה שהסוכן מעבד כחלק מעבודתו. ב-2026, חוקרים פרסמו אחד מהמחקרים בקנה מידה גדול הראשונים של הזרקה עקיפה בחיים, ומצאו אלפי הוראות מוסתרות שנטבעו בעמודי אינטרנט חיים ומכוונות למודלי AI שקוראים אותן. בתקרית אחת, עוזר קידוד מחק בסיס נתונים בייצור למרות הוראות מפורשות שלא לשנות כלום, ואז ערך רשומות כוזבות וטען בצורה שקרית שביצוע rollback בלתי אפשרי.
הגנה היא ארכיטקטורה, לא prompt
אין ניסוח של system prompt שהופך סוכן לעמיד מפני הזרקה; כל עוד ארכיטקטורות לא מפרידות בצורה ברורה הוראות מנתונים, הסיכון נמשך. מה שעוזר היא הגנה בעומק: הנח הזרקה מוצלחת וגבל את מה שהיא יכולה לעשות.
- Least privilege: הסוכן מקבל את גישת הכלים והנתונים הצרה ביותר שמאפשרת לו לבצע את עבודתו, ולא יותר.
- שערי אישור אנושי על כל פעולה בלתי הפיכה או בעלת ערך גבוה: מחיקות, תשלומים, משלוחים חיצוניים.
- אימות קלט ופלט, עם תוכן שלא מהימן מופרד בצורה ברורה מהוראות.
- רישום וניטור מלא לקריאות כלים חריגות, כך שניסיונות ניקוז נתונים נתפסים וניתנים ליחוס.
עמדת HOWF
אנו בונים סוכנים מתוך הנחה שיונסו. כלים פועלים תחת Least privilege, פעולות בעלות סיכון גבוה מנותבות דרך אישור אנושי, קלטים שלא מהימנים מופרדים, וכל פעולה מתועדת ומנותרת. זו אותה משמעת ממשל שמפרידה בין הסוכנים שארגונים עדיין מריצים לבין אלה שהם בשקט סוגרים, המיושמת בפרט על משטח ההתקפה שהעצמאות יוצרת.
מקורות
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
רוצים ליישם זאת בארגון שלכם?