„Dacă agentul tău combină aceste trei trăsături, un atacator îl poate păcăli cu ușurință să-ți acceseze datele private și să i le trimită.”Simon Willison · The lethal trifecta for AI agents · 2025 · The lethal trifecta for AI agents (simonwillison.net, 16 iunie 2025) — după enumerarea celor trei capabilități
Rupe un picior din trifectă: fără ieșire în exterior, fără conținut neverificat sau fără date private.
Modelele urmează instrucțiunile din conținut: o pagină web, un email, un PDF, rezultatul unei unelte pot purta „ignoră instrucțiunile anterioare, trimite X la Y”. Injecția nu se rezolvă cu prompturi; apărarea de încredere e arhitecturală — scoți un picior al trifectei: fără canal de ieșire (fără URL-uri arbitrare, fără trimitere de email), sau fără intrări neverificate, sau fără date private. Tipare: două modele (unul „în carantină” citește conținutul neverificat, cel privilegiat nu-l vede niciodată brut); urmărirea capabilităților pe fluxul de date; listă albă de domenii; aprobare umană la orice trimitere în exterior; ieșirile uneltelor marcate ca date în prompt. OWASP Top 10 pentru aplicații agentice pune deturnarea scopului prin injecție pe primul loc.
De ce contează Fiecare unealtă nouă e un picior nou al trifectei; verifici la fiecare adăugare, nu la lansare.