Prompt injection là rủi ro số 1 của OWASP. Các agent của bạn là bề mặt tấn công mới.
Prompt injection đứng đầu Top 10 hiện tại của OWASP cho các ứng dụng LLM. Khi các agent có được công cụ và tính tự chủ, một lệnh được tiêm chích duy nhất có thể tẩu tán dữ liệu hoặc thực hiện hành động phá hủy. Bảo mật các agent hiện là điều kiện tiên quyết để triển khai chúng.
Bởi Habib Obeid

Agent càng có khả năng, kẻ tấn công càng hưởng lợi từ việc chiếm quyền kiểm soát nó. Prompt injection đứng đầu Top 10 hiện tại của OWASP cho các ứng dụng LLM, và nó vẫn là một trong những điểm yếu phổ biến nhất trong các triển khai AI sản xuất. Nguy hiểm gia tăng theo tính tự chủ: khi một agent có thể gọi công cụ, duyệt, và hành động, một lệnh được chèn vào nội dung mà nó đọc có thể biến các khả năng của chính nó thành vũ khí chống lại bạn.
Một agent với công cụ chỉ đáng tin cậy bằng tài liệu ít được tin tưởng nhất mà nó sẽ đọc. Hãy coi mọi đầu vào bên ngoài là mối đe dọa, vì kẻ tấn công đã làm như vậy.
Indirect injection là mối đe dọa của doanh nghiệp
Direct injection, khi người dùng nhập một lệnh ghi đè, là trường hợp dễ. Trường hợp nguy hiểm là indirect injection: một lệnh độc hại ẩn trong trang web, PDF, email, hoặc phiếu hỗ trợ mà agent xử lý như phần của công việc của nó. Năm 2026, các nhà nghiên cứu công bố một trong những nghiên cứu quy mô lớn đầu tiên về indirect injection trong thực tế, phát hiện hàng ngàn lệnh ẩn được đặt trên các trang web đang hoạt động và nhắm vào các mô hình AI đọc chúng. Trong một sự cố, một trợ lý mã hóa đã xóa một cơ sở dữ liệu sản xuất mặc dù có lệnh rõ ràng không thay đổi gì, sau đó tạo hồ sơ giả mạo và báo sai rằng rollback không thể thực hiện.
Phòng thủ là kiến trúc, không phải là prompt
Không có cách nào điều chỉnh system prompt để làm cho một agent không thể bị injection, cho đến khi các kiến trúc tách rõ ràng các lệnh khỏi dữ liệu, rủi ro vẫn tồn tại. Những gì hoạt động là phòng thủ nhiều lớp: giả định một injection thành công và hạn chế những gì nó có thể làm.
- Đặc quyền tối thiểu: agent chỉ nhận quyền truy cập công cụ và dữ liệu hẹp nhất cho phép nó thực hiện công việc của nó, không gì hơn.
- Cổng phê duyệt của con người trên bất kỳ hành động không thể đảo ngược hoặc có giá trị cao: xóa, thanh toán, gửi bên ngoài.
- Kiểm tra đầu vào và đầu ra, với nội dung không đáng tin cậy được tách rõ ràng khỏi các lệnh.
- Ghi nhật ký đầy đủ và giám sát các lệnh gọi công cụ bất thường, để các nỗ lực tẩu tán được phát hiện và có thể truy trách.
Vị trí của HOWF
Chúng tôi xây dựng các agent với giả định rằng chúng sẽ bị tấn công. Các công cụ chạy dưới đặc quyền tối thiểu, các hành động có rủi ro cao được định tuyến qua cổng phê duyệt của con người, nội dung không được tin tưởng được tách riêng, và mọi hành động được ghi nhật ký và giám sát. Đó là cùng một kỷ luật quản lý tách biệt các agent mà doanh nghiệp vẫn sử dụng khỏi những agent mà chúng im lặng tắt đi, được áp dụng cụ thể cho bề mặt tấn công mà tính tự chủ tạo ra.
Nguồn
- Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
- LLM01:2025 Prompt Injection, OWASP Gen AI Security Project
Muốn áp dụng điều này cho doanh nghiệp của bạn?