Création d'agents
Avant le déploiement : comment concevoir une architecture d'agent sécurisée ? Quels patterns d'orchestration éviter ? Comment valider les tool calls ?
- Tool use validation absent
- Escalade de privilèges
- Memory poisoning entre agents
- Orchestration non contrainte
- Secrets en contexte partagé
Sécurité LLM
Le modèle lui-même : prompt injection, jailbreaking, extraction de données, exposition de system prompt. Vulnérabilités du modèle en boîte noire.
- Prompt injection (directe)
- Indirect prompt injection (RAG)
- Jailbreaking techniques
- Data extraction / PII leak
- System prompt exposure
Agents en production
Surveillance runtime : comportement anormal, drift sémantique, détection d'attaques, incident response. Instrumentalisation complète du système.
- Semantic drift non détecté
- Model poisoning silencieux
- Monitoring insuffisant
- Incident response absent
- Supply chain vulnerabilities
OWASP LLM Top 10 (2025)
Classement des 10 risques critiques pour les applications basées sur des LLM. Publié par OWASP en 2023, mis à jour annuellement. C'est le standard de facto pour la sécurité LLM.
- 01 — Prompt Injection
- 02 — Insecure Output Handling
- 03 — Training Data Poisoning
- 04 — Model Denial of Service
- 05 — Supply Chain Vulnerabilities
- 06 — Sensitive Information Disclosure
- 07 — Insecure Plugin Design
- 08 — Excessive Agency
- 09 — Overreliance
- 10 — Model Theft
MITRE ATLAS (2024)
Matrice d'attaques adversarielles pour les systèmes d'IA. Framework tactics & techniques inspiré de MITRE ATT&CK, structurant les vecteurs d'attaque documentés contre les modèles de ML/IA.
- Reconnaissance & resource development
- Initial access (données poisonnées)
- Execution & persistence
- Privilege escalation
- Defense evasion
- Discovery & collection
- Exfiltration & impact
Red teaming automatisé, filtering, monitoring et evaluation. Chaque outil couvre une surface de sécurité différente. La plupart sont open-source.
Garak
PyRIT
PromptBench
Llama Guard
Azure Content Safety
Giskard
DeepEval
Bandit
| Vecteur | Pilier | Probabilité | Impact | Priorité |
|---|---|---|---|---|
| Prompt Injection (directe) | LLM | Très haute | Critique | P0 |
| Indirect Prompt Injection (RAG) | LLM + Agents | Haute | Critique | P0 |
| Tool use validation manquante | Création agents | Très haute | Critique | P0 |
| Jailbreaking / bypass guardrails | LLM | Très haute | Élevé | P1 |
| Data extraction / PII leak | LLM | Haute | Critique | P1 |
| Escalade de privilèges (agents) | Création agents | Haute | Critique | P1 |
| Semantic drift non détecté | Production | Moyenne | Élevé | P2 |
| Model poisoning (training data) | Création agents | Moyenne | Critique | P2 |
| Supply chain vulnerabilities | Production | Moyenne | Élevé | P2 |