Empoisonnement de données

Data poisoning : fausser un modèle par ce qu’il apprend

L’empoisonnement de données consiste à introduire des exemples trompeurs dans ce qu’un modèle d’intelligence artificielle apprend, pour altérer son comportement : l’affaiblir, le biaiser ou y cacher une réaction que l’attaquant déclenchera plus tard.

Pendant l’apprentissage, pas pendant la question

L’injection de prompt trompe un modèle au moment où il lit ; l’empoisonnement agit plus tôt, pendant l’entraînement, l’ajustement ou la constitution des documents qu’il consulte. Le défaut s’inscrit alors dans le modèle lui-même : il survit aux changements de consignes et se retrouve dans chaque copie.

Quelques centaines de documents suffisent

En octobre 2025, une étude menée par l’institut britannique de sécurité de l’IA, l’Institut Alan Turing et Anthropic a montré que 250 documents piégés suffisaient à installer une porte dérobée dans des modèles de langage de 600 millions à 13 milliards de paramètres, quelle que soit leur taille. Une fois le mot déclencheur appris, il suffit de l’écrire pour faire dérailler le modèle.

Le poison comme défense

Des artistes l’emploient pour protéger leurs œuvres : Nightshade, publié en janvier 2024 par l’université de Chicago, altère imperceptiblement une image afin qu’un modèle qui l’apprend sans autorisation associe mal les mots et les formes. L’outil a été téléchargé 250 000 fois dans les cinq jours qui ont suivi sa sortie.

Ce qui protège un modèle d’entreprise

Connaître l’origine des données qui servent à l’entraîner ou à l’ajuster, en garder la trace, limiter qui peut en ajouter, et tester le modèle sur des cas connus avant chaque mise en service. L’OWASP place l’empoisonnement des données et des modèles en quatrième position de sa liste consacrée aux modèles de langage : il se traite comme la sécurité d’une chaîne de fournisseurs, en vérifiant chaque apport.

Mise à jour : 28 septembre 2026