Distillation

Entraîner un petit modèle en lui faisant imiter un grand

La distillation consiste à entraîner un modèle réduit en lui faisant reproduire les réponses d'un modèle beaucoup plus gros. Le petit hérite d'une part du comportement du grand, pour une fraction du coût de calcul.

Le principe

Le grand modèle répond à un très grand nombre de questions ; ses réponses servent de matière d’entraînement au petit. Celui-ci n’apprend pas du monde, il apprend d’un autre modèle.

Ce qu’on y gagne

Un modèle qui tient sur une machine ordinaire, répond plus vite, coûte moins cher à faire tourner, et peut être hébergé là où l’on veut plutôt que chez un fournisseur.

Ce qu’on y perd

La marge. Le petit modèle suit correctement les cas courants et décroche sur les cas rares — ceux-là mêmes où l’on aurait justement eu besoin d’un avis fiable, et où l’écart ne se voit pas au premier regard.

Pourquoi c’est disputé

Les conditions d’utilisation des grands modèles interdisent en général de s’en servir pour en entraîner un concurrent. L’accusation a déjà été portée publiquement entre acteurs du secteur, et elle reste difficile à prouver : le résultat ressemble à un modèle entraîné normalement.

Mise à jour : 1 septembre 2026