Audit de sécurité IA end-to-end

Design, déploiement, production — sécuriser l'IA à chaque étape

Les vulnérabilités des systèmes IA vont bien au-delà du modèle : agents autonomes mal configurés, LLM manipulés via prompt injection, systèmes en production sans monitoring. Cet observatoire couvre les trois phases critiques d'audit, les référentiels de sécurité (OWASP LLM, MITRE ATLAS) et les outils pour tester, détecter et se défendre. Il vous détaille ce que les cabinets de conseil en déploiement de l'IA et les opérateurs eux-mêmes ne vous disent pas, ou si peu, en matière de sécurité.

Architecture audit
Les 3 piliers de l'audit IA
1

Création d'agents

Avant le déploiement : comment concevoir une architecture d'agent sécurisée ? Quels patterns d'orchestration éviter ? Comment valider les tool calls ?

Risques spécifiques
  • Tool use validation absent
  • Escalade de privilèges
  • Memory poisoning entre agents
  • Orchestration non contrainte
  • Secrets en contexte partagé
Audit complet →
2

Sécurité LLM

Le modèle lui-même : prompt injection, jailbreaking, extraction de données, exposition de system prompt. Vulnérabilités du modèle en boîte noire.

Risques spécifiques
  • Prompt injection (directe)
  • Indirect prompt injection (RAG)
  • Jailbreaking techniques
  • Data extraction / PII leak
  • System prompt exposure
Audit complet →
3

Agents en production

Surveillance runtime : comportement anormal, drift sémantique, détection d'attaques, incident response. Instrumentalisation complète du système.

Risques spécifiques
  • Semantic drift non détecté
  • Model poisoning silencieux
  • Monitoring insuffisant
  • Incident response absent
  • Supply chain vulnerabilities
Audit complet →
Cadres de référence
OWASP LLM Top 10 & MITRE ATLAS

OWASP LLM Top 10 (2025)

Classement des 10 risques critiques pour les applications basées sur des LLM. Publié par OWASP en 2023, mis à jour annuellement. C'est le standard de facto pour la sécurité LLM.

  • 01 — Prompt Injection
  • 02 — Insecure Output Handling
  • 03 — Training Data Poisoning
  • 04 — Model Denial of Service
  • 05 — Supply Chain Vulnerabilities
  • 06 — Sensitive Information Disclosure
  • 07 — Insecure Plugin Design
  • 08 — Excessive Agency
  • 09 — Overreliance
  • 10 — Model Theft
Consulter le guide →

MITRE ATLAS (2024)

Matrice d'attaques adversarielles pour les systèmes d'IA. Framework tactics & techniques inspiré de MITRE ATT&CK, structurant les vecteurs d'attaque documentés contre les modèles de ML/IA.

  • Reconnaissance & resource development
  • Initial access (données poisonnées)
  • Execution & persistence
  • Privilege escalation
  • Defense evasion
  • Discovery & collection
  • Exfiltration & impact
Consulter le framework →
Instrumentation
Outils d'audit IA

Red teaming automatisé, filtering, monitoring et evaluation. Chaque outil couvre une surface de sécurité différente. La plupart sont open-source.

Red teaming

Garak

Framework NVIDIA de red teaming LLM. Probes modulaires, couverture OWASP LLM complète. CLI rapide pour tester en batch.
Guide complet →
Red teaming

PyRIT

Microsoft orchestration framework. Agents adversariels, scénarios complexes, intégration avec LLM orchestrators. Python.
Guide complet →
Red teaming

PromptBench

Dataset d'adversarial prompts publics. Benchmark de jailbreaks documentés. Utile pour évaluation rapide vs techniques connues.
Guide complet →
Filtering / Modération

Llama Guard

Meta classifier natif. Classification inputs/outputs sur risques définis. Fine-tunable sur domaine custom. Gratuit.
Guide complet →
Filtering / Modération

Azure Content Safety

Service cloud Microsoft. Classification contenu, prompt detection, coûts par requête. Alternative commerciale à Llama Guard.
Guide complet →
Monitoring / Evaluation

Giskard

Hallucination detection, RAG evaluation, semantic drift. Model cards, test suites. Focus évaluation qualité + sécurité.
Guide complet →
Monitoring / Evaluation

DeepEval

LLM-as-judge pour scoring qualité réponses. Factualité, toxicité, relevance. Intégration avec LLM providers.
Guide complet →
Code security

Bandit

Analyse sécurité Python. Détection secrets, injection SQL indirecte, anti-patterns. Essentiel pour code agents.
Guide complet →
Synthèse
Matrice de risque — 9 vecteurs prioritaires
Vecteur Pilier Probabilité Impact Priorité
Prompt Injection (directe) LLM Très haute Critique P0
Indirect Prompt Injection (RAG) LLM + Agents Haute Critique P0
Tool use validation manquante Création agents Très haute Critique P0
Jailbreaking / bypass guardrails LLM Très haute Élevé P1
Data extraction / PII leak LLM Haute Critique P1
Escalade de privilèges (agents) Création agents Haute Critique P1
Semantic drift non détecté Production Moyenne Élevé P2
Model poisoning (training data) Création agents Moyenne Critique P2
Supply chain vulnerabilities Production Moyenne Élevé P2