Injection de prompt
Changement de rôle, urgence, obfuscation ou demande anodine : les règles du chatbot sont contournées sans exploiter le serveur.
Audit sécurité IA · Lyon & remote France
J'audite les chatbots et systèmes RAG avant leur mise en production : scénarios OWASP, taux de succès des attaques, preuves rejouables et recommandations directement exploitables.
Le risque réel
Un assistant peut respecter son rôle dans 99 % des conversations et exposer une donnée au mauvais utilisateur sur le scénario restant. L'audit transforme ce doute en résultats mesurables.
Changement de rôle, urgence, obfuscation ou demande anodine : les règles du chatbot sont contournées sans exploiter le serveur.
Le modèle reçoit le mauvais document, puis restitue salaires, contrats ou données clients à un utilisateur non habilité.
Écrire « je suis administrateur » dans le chat ne doit jamais devenir une preuve d'identité ni débloquer un index confidentiel.
Cas d'étude · Juillet 2026
Le problème principal n'était pas un « chatbot désobéissant ». Le pipeline envoyait au modèle des documents que l'utilisateur n'aurait jamais dû pouvoir récupérer.
3 findings prioritaires
Chaque finding est relié à une preuve rejouable et à un re-test. Pas de capture isolée, pas de démonstration sensationnaliste.
LLM01-005
Des chunks confidentiels étaient récupérés avant même que le modèle ne réponde.
LLM01-006
Une simple affirmation « DRH autorisé » désactivait initialement le filtre documentaire.
LLM01-004
Une tâche d'apparence anodine poussait le modèle à compléter des champs avec des valeurs sensibles.
Défense en profondeur
Le cas d'étude a conduit à une architecture de défense en quatre couches indépendantes.
Neutraliser les instructions cachées avant l'indexation des emails et documents.
Appliquer ACL, filtrage par sensibilité et authentification côté serveur.
Séparer clairement instructions et données, puis durcir le comportement attendu.
Bloquer les motifs sensibles et journaliser les tentatives pour le RSSI.
La méthode
L'objectif n'est pas de collectionner les jailbreaks. Il est de produire une décision claire : quels scénarios réussissent, pourquoi, quel est l'impact et que corriger en premier.
Intervention autorisée uniquement
Clone, lab ou préproduction avec données de test.
Système, rôle utilisateur, données sensibles, exclusions et critères de succès attaquant.
Corpus manuel adapté et campagnes reproductibles inspirées de l'OWASP LLM Top 10.
ASR global et par famille, réponses horodatées, preuves de concept rejouables.
Jusqu'à trois findings avec impact, cause racine, recommandations et restitution.
Ce que vous recevez
La synthèse parle au décideur. Le détail permet à l'équipe technique de reproduire le problème sans devoir interpréter une capture d'écran.
Risques majeurs, chiffres clés, verdict du périmètre et prochaines décisions.
Vecteur, impact, preuve, cause racine et recommandation actionnable.
Journal de campagne, ASR et conditions nécessaires au re-test après correction.
Offre de lancement
Un périmètre volontairement court pour obtenir des résultats concrets sans lancer un audit de plusieurs semaines.
À propos
Consultant en sécurité des systèmes d'IA générative
Mon parcours réunit infrastructure SISR, expérience en environnement SI à France Télévisions et pratique documentée du Red Teaming LLM. Je travaille à l'intersection du modèle, du RAG et des contrôles d'accès : là où une démonstration de jailbreak ne suffit plus.
Mon approche : mesurer, documenter, corriger puis re-tester. Le but est de donner aux PME, éditeurs SaaS et intégrateurs une lecture claire de leur exposition avant la mise en production.
Avant la mise en production
Un échange de 15 minutes suffit pour vérifier si le diagnostic correspond à votre périmètre.