Apprentissage par renforcement
Entraîner un modèle par essais et récompenses, sans lui montrer la bonne réponse
Comment il apprend
Le modèle produit une réponse, un signal lui indique si elle est bonne, il ajuste, recommence. Des millions de fois. Rien ne lui dit quoi faire ; il déduit une stratégie de ce qui a été récompensé.
Ce qui le distingue de l’apprentissage supervisé
En supervisé, on montre des milliers de couples question-réponse et le modèle imite. En renforcement, on ne montre rien : on note. Le premier reproduit ce qu’on lui a appris, le second peut trouver des chemins que personne n’avait envisagés.
Quand l’humain entre dans la boucle
Des personnes classent les réponses de la meilleure à la moins bonne, et ces classements deviennent le signal de récompense. C’est ce procédé qui a rendu les assistants conversationnels utilisables.
Là où il dérape
Le modèle optimise exactement ce qu’on mesure, jamais ce qu’on voulait. Une récompense mal formulée produit un comportement conforme au calcul et absurde à l’usage.
Mise à jour : 1 septembre 2026
