office@safebyte.io București, România ISO 27001:2023 · ISO 9001:2023
Testare ofensivă

Securitate AI / LLM

Un model de limbaj execută instrucțiuni — inclusiv pe cele ascunse într-un document pe care îl citește sau într-un răspuns de unealtă. Când îi dai acces la date și la acțiuni reale, îi dai și o suprafață de atac nouă. O testăm după OWASP Top 10 pentru LLM și MITRE ATLAS.

Français: această pagină nu e încă tradusă. Textul de mai jos e în Română.

Securitate AI / LLM

Un model de limbaj nu distinge instrucțiunile tale de instrucțiunile ascunse într-un e-mail, un document sau o pagină web pe care le citește. În momentul în care îl conectezi la datele tale și îi dai unelte cu care poate acționa — să trimită mesaje, să interogheze baze, să apeleze API-uri — orice text pe care îl procesează devine un potențial ordin. Riscul nu e teoretic: un „prompt injection” indirect, plantat într-o sursă pe care agentul o consultă, poate scurge date sau declanșa acțiuni pe care niciun utilizator nu le-a cerut. Testăm exact această suprafață nouă.

Cum abordăm

Modelăm întâi sistemul, nu doar promptul: modelul și prompt-ul de sistem, sursele RAG, uneltele pe care agentul le poate apela, cât de autonom e și cine consumă ieșirea lui. Apoi testăm adversarial, pe OWASP Top 10 pentru aplicații LLM (2025), structurat cu tacticile MITRE ATLAS:

  • Prompt injection — direct și, mai periculos, indirect: instrucțiuni ascunse în documente, conținut web sau răspunsuri de unelte pe care agentul le tratează ca date de încredere; jailbreak-uri și ocolirea barierelor
  • Scurgeri de informații sensibile — date de antrenament, ale altor utilizatori, secrete din context, scurgerea prompt-ului de sistem (regulile și filtrele interne)
  • Tratarea nesigură a ieșirilor — ieșirea modelului care ajunge nefiltrată în XSS, SSRF, SQLi sau execuție de comenzi în sistemele din aval
  • Autonomie excesivă — agenți supra-privilegiați care fac acțiuni reale; abuz de apeluri de funcții, „confused deputy” prin unelte, escaladare prin lanțuri de unelte
  • Slăbiciuni de RAG — otrăvirea magaziei de vectori, recuperare abuzată, scurgeri între chiriași
  • Consum nelimitat — DoS prin cost/token, extragerea modelului

Ce primești

  • Constatări mapate pe OWASP Top 10 pentru LLM și MITRE ATLAS, cu prompt-uri și payload-uri reproductibile
  • Evaluarea barierelor, a tratării ieșirilor și a domeniului de privilegii al agenților
  • Remediere concretă: filtrarea intrărilor și ieșirilor, unelte cu privilegii minime, igiena surselor RAG, limite de rată și cost, și „om în buclă” pentru acțiunile cu impact mare