Injection de prompt
Prompt injection, infiltration de requête : détourner une IA par du texte
Un nom emprunté à une vieille faille
Le terme a été proposé en septembre 2022 par le développeur Simon Willison, après qu’un spécialiste des données eut montré combien il était facile de faire dérailler un assistant conversationnel. Il l’a calqué sur l’injection SQL, où des données saisies par un utilisateur sont exécutées comme des ordres : un modèle de langage ne distingue pas mieux ce qu’on lui demande de faire de ce qu’on lui donne à lire.
Directe ou cachée
Dans sa forme directe, l’utilisateur tape lui-même les instructions détournées. La forme indirecte est plus inquiétante : l’instruction est dissimulée dans une page web, un courriel, un document ou une invitation d’agenda que l’IA consulte pour rendre service, parfois écrite en blanc sur fond blanc. L’utilisateur ne voit rien ; l’assistant, lui, lit tout et obéit.
Un risque qui grandit avec les agents
Tant qu’une IA se contente de répondre, le dommage se limite à une réponse trompeuse. Dès qu’elle peut lire la messagerie, ouvrir des fichiers, naviguer ou envoyer des messages, une instruction cachée peut lui faire transmettre des données à l’extérieur ou agir à la place de son utilisateur. L’OWASP place l’injection de prompt au premier rang des risques des applications fondées sur des modèles de langage, et admet qu’il n’est pas certain qu’une parade infaillible existe.
Borner ce que l’IA peut faire
La défense la plus solide ne consiste pas à filtrer chaque phrase, mais à limiter les droits : ne donner à un assistant que les accès dont il a besoin, faire valider par une personne toute action qui engage l’entreprise, distinguer les sources de confiance de celles qui ne le sont pas. Une IA qui ne peut rien envoyer seule ne peut pas être poussée à le faire.
Mise à jour : 27 septembre 2026
