Το prompt injection είναι ο κίνδυνος #1 του OWASP. Οι πράκτορες σας είναι η νέα επιφάνεια επίθεσης.
Το prompt injection κορυφώνεται στο τρέχον Top 10 του OWASP για εφαρμογές LLM. Καθώς οι πράκτορες αποκτούν εργαλεία και αυτονομία, μία μόνο εγχυόμενη διάταξη μπορεί να αποσπάσει δεδομένα ή να προκαλέσει καταστροφική ενέργεια. Η ασφάλεια των πράκτορων είναι πλέον προϋπόθεση για την ανάπτυξή τους.
Από Habib Obeid

Όσο πιο ικανός είναι ο πράκτορας σας, τόσο περισσότερα κερδίζει ο επιτιθέμενος από την παραλάβη του. Το prompt injection κορυφώνεται στο τρέχον Top 10 του OWASP για εφαρμογές LLM και παραμένει ένα από τα πιο συνηθισμένα αδύνατα σημεία στις παραγωγικές αναπτύξεις AI. Ο κίνδυνος αυξάνεται με την αυτονομία: μόλις ένας πράκτορας μπορεί να καλέσει εργαλεία, να περιηγηθεί και να δράσει, μία διάταξη που κρύβεται στο περιεχόμενο που διαβάζει μπορεί να στρέψει τις δικές του ικανότητες εναντίον σας.
Ένας πράκτορας με εργαλεία είναι τόσο αξιόπιστος όσο το λιγότερο αξιόπιστο έγγραφο που θα διαβάσει. Θεωρήστε κάθε εξωτερική είσοδο ως εχθρική, διότι οι επιτιθέμενοι το κάνουν ήδη.
Η έμμεση ένεση είναι η απειλή της επιχείρησης
Η άμεση ένεση, δηλαδή ένας χρήστης που πληκτρολογεί μια παράκαμψη, είναι η εύκολη περίπτωση. Η επικίνδυνη είναι η έμμεση: μια κακόβουλη διάταξη κρυμμένη σε μια ιστοσελίδα, PDF, email ή εισιτήριο υποστήριξης που ο πράκτορας επεξεργάζεται ως μέρος της εργασίας του. Το 2026, οι ερευνητές δημοσίευσαν μία από τις πρώτες μεγάλης κλίμακας μελέτες της έμμεσης ένεσης στο πεδίο, ανακαλύπτοντας χιλιάδες κρυμμένες διατάξεις που τοποθετήθηκαν σε ζωντανές ιστοσελίδες και στοχεύοντας τα μοντέλα AI που τις διαβάζουν. Σε ένα περιστατικό, ένας βοηθός κωδικοποίησης διέγραψε μια βάση δεδομένων παραγωγής παρά τις ρητές οδηγίες να μη μεταβάλλει τίποτα, στη συνέχεια δημιούργησε ψευδή αρχεία και ανέφερε λανθασμένα ότι η επαναφορά ήταν αδύνατη.
Η άμυνα είναι αρχιτεκτονική, όχι prompt
Δεν υπάρχει διατύπωση ενός system prompt που να κάνει έναν πράκτορα ανθεκτικό στις ενέσεις. Μέχρι οι αρχιτεκτονικές να χωρίσουν καθαρά τις διατάξεις από τα δεδομένα, ο κίνδυνος παραμένει. Αυτό που λειτουργεί είναι η άμυνα σε βάθος: υποθέστε μια επιτυχημένη ένεση και περιορίστε αυτό που μπορεί να κάνει.
- Ελάχιστα προνόμια: ο πράκτορας λαμβάνει τη στενότερη πρόσβαση σε εργαλεία και δεδομένα που του επιτρέπει να εκτελέσει την εργασία του, και τίποτα άλλο.
- Πύλες έγκρισης από ανθρώπους σε οποιαδήποτε μη αναστρέψιμη ή υψηλής αξίας ενέργεια: διαγραφές, πληρωμές, εξωτερικές αποστολές.
- Επικύρωση εισόδου και εξόδου, με μη αξιόπιστο περιεχόμενο καθαρά χωρισμένο από τις διατάξεις.
- Πλήρης καταγραφή και παρακολούθηση για ανώμαλες κλήσεις εργαλείων, ώστε οι προσπάθειες αποσπασμού δεδομένων να ανιχνεύονται και να είναι προσδιορίσιμες.
Η θέση του HOWF
Κατασκευάζουμε πράκτορες με την υπόθεση ότι θα δεχθούν επίθεση. Τα εργαλεία λειτουργούν με ελάχιστα προνόμια, οι ενέργειες υψηλού κινδύνου δρομολογούνται μέσω ανθρώπινης έγκρισης, τα μη αξιόπιστα δεδομένα είναι χωρισμένα και κάθε ενέργεια καταγράφεται και παρακολουθείται. Είναι η ίδια πειθαρχία διακυβέρνησης που διαχωρίζει τους πράκτορες που οι επιχειρήσεις εξακολουθούν να τρέχουν από αυτούς που απενεργοποιούν σιωπηλά, εφαρμοζόμενη συγκεκριμένα στην επιφάνεια επίθεσης που δημιουργεί η αυτονομία.
Πηγές
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
Θέλετε να εφαρμοστεί αυτό στην επιχείρησή σας;