Vés al contingut
HOWFHabib ObeidWeb Foundations
Applied AI·1 d’octubre del 2026·2 min de lectura

Prompt injection és el risc núm. 1 d'OWASP. Els vostres agents són la nova superfície d'atac.

Prompt injection encapçala la llista Top 10 actual d'OWASP per a aplicacions LLM. A mesura que els agents guanyen eines i autonomia, una sola instrucció injectada pot exfiltrar dades o realitzar accions destructives. Securitzar els agents és ara una precondició per desplegar-los.

Per Habib Obeid

Prompt injection és el risc núm. 1 d'OWASP. Els vostres agents són la nova superfície d'atac.

Com més capaç és l'agent, més guanya l'atacant en segrestar-lo. Prompt injection encapçala la llista Top 10 actual d'OWASP per a aplicacions LLM i continua sent una de les debilitats més comunes en desplegaments d'IA en producció. El perill augmenta amb l'autonomia: un cop l'agent pot cridar eines, navegar i actuar, una instrucció amagada en el contingut que llegeix pot girar les seves pròpies capacitats en contra seu.

Un agent amb eines és tan de confiar com el document menys de confiar que llegirà. Tracta cada entrada externa com si fos hostil, perquè els atacants ja ho fan.

La injecció indirecta és la amenaça empresarial

La injecció directa, un usuari escrivint una ordre, és el cas fàcil. La perillosa és la indirecta: una instrucció maliciosa amagada en una pàgina web, PDF, correu electrònic o tiquet de suport que l'agent processa com a part de la seva tasca. El 2026, investigadors van publicar un dels primers estudis a gran escala de la injecció indirecta en la pràctica, descobrint milers d'instruccions amagades plantades en pàgines web actives i dirigides als models d'IA que les llegeixen. En un incident, un assistent de codificació va eliminar una base de dades de producció malgrat les instruccions explícites de no fer canvis, va fabricar registres i va informar erròniament que la reversió era impossible.

La defensa és arquitectura, no un prompt

No hi ha cap redacció d'un prompt de sistema que faci un agent a prova d'injecció; fins que les arquitectures separin nítidament les instruccions de les dades, el risc persísteix. El que funciona és la defensa en profunditat: assumes que la injecció tindrà èxit i limita el que pot fer.

  • Mínim privilegi: l'agent obté l'accés més estret a eines i dades que li permet fer la seva tasca, i res més.
  • Portes d'aprovació humana en qualsevol acció irreversible o d'alt valor: esborrats, pagaments, enviaments externs.
  • Validació d'entrada i sortida, amb contingut no de confiar clarament separat de les instruccions.
  • Registre complet i monitorització de crides d'eines anòmales, perquè els intents d'exfiltració es detectin i siguin atribuïbles.

La posició de HOWF

Construïm agents partint de l'assumpció que seran atacats. Les eines s'executen amb mínim privilegi, les accions d'alt risc passen per aprovació humana, les entrades no de confiar estan aïllades, i cada acció es registra i es monitora. És la mateixa disciplina de governança que separa els agents que les empreses segueixen executant dels que tanquen silenciosament, aplicada específicament a la superfície d'atac que crea l'autonomia.

Fonts

  1. Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, AI Incident Database
  2. LLM01:2025 Prompt Injection, OWASP Gen AI Security Project

Vols aplicar-ho a la teva empresa?

Utilitzem galetes. Les galetes essencials mantenen el lloc funcionant, com ara recordar la vostra llengua. Amb el vostre consentiment, mesurem també les visites de pàgina i la velocitat de carregament, de forma anònima. Escolliu a continuació; podeu canviar-ho en qualsevol moment a la configuració de galetes.