Apprentissage par renforcement

Entraîner un modèle par essais et récompenses, sans lui montrer la bonne réponse

L'apprentissage par renforcement entraîne un modèle en le laissant essayer, puis en récompensant ce qui va dans le bon sens. Personne ne lui fournit la réponse attendue : il la découvre en cherchant ce qui rapporte.

Comment il apprend

Le modèle produit une réponse, un signal lui indique si elle est bonne, il ajuste, recommence. Des millions de fois. Rien ne lui dit quoi faire ; il déduit une stratégie de ce qui a été récompensé.

Ce qui le distingue de l’apprentissage supervisé

En supervisé, on montre des milliers de couples question-réponse et le modèle imite. En renforcement, on ne montre rien : on note. Le premier reproduit ce qu’on lui a appris, le second peut trouver des chemins que personne n’avait envisagés.

Quand l’humain entre dans la boucle

Des personnes classent les réponses de la meilleure à la moins bonne, et ces classements deviennent le signal de récompense. C’est ce procédé qui a rendu les assistants conversationnels utilisables.

Là où il dérape

Le modèle optimise exactement ce qu’on mesure, jamais ce qu’on voulait. Une récompense mal formulée produit un comportement conforme au calcul et absurde à l’usage.

Mise à jour : 1 septembre 2026