Corpus d’entraînement

L’ensemble des textes sur lesquels un modèle a été entraîné

L’ensemble des textes utilisés pour entraîner un modèle, et qui détermine ce qu’il saura produire.

Ce qu’il contient

Des volumes considérables de texte de toute origine : ouvrages, presse, documentation technique, forums et conversations en ligne. Pratiquement tout ce qui est accessible peut y entrer.

Pourquoi sa composition décide de tout

Un modèle ne connaît que ce que son corpus contenait. Un domaine peu représenté produira des réponses vagues ; un domaine surreprésenté, des réponses assurées sur un point de vue particulier.

La date compte aussi

Un corpus est arrêté à une date. Ce qui s’est produit après lui est inconnu du modèle, sauf si l’outil consulte des sources extérieures au moment de répondre.

Ce qu’une entreprise peut en déduire

La fiabilité attendue dépend du sujet : très élevée là où la matière est abondante et stable, plus faible sur un domaine spécialisé, récent, ou propre à une organisation.

Mise à jour : 16 août 2026