Corpus d’entraînement

L’ensemble des textes sur lesquels un modèle a été entraîné

Le corpus d’entraînement est l’ensemble des textes utilisés pour entraîner un modèle, et qui détermine ce qu’il saura produire. Sa composition, comme ses manques, oriente toutes les réponses qu’il donnera ensuite.

Ce qu’il contient

Le corpus d’entraînement rassemble des volumes considérables de texte de toute origine : ouvrages, presse, documentation technique, forums et conversations en ligne. Pratiquement tout ce qui est accessible peut y entrer.

Pourquoi sa composition décide de tout

Un modèle ne connaît que ce que son corpus contenait. Un domaine peu représenté produira des réponses vagues ; un domaine surreprésenté, des réponses assurées sur un point de vue particulier.

La date compte aussi

Un corpus est arrêté à une date. Ce qui s’est produit après lui est inconnu du modèle, sauf si l’outil consulte des sources extérieures au moment de répondre.

Ce qu’une entreprise peut en déduire

La fiabilité attendue dépend du sujet : très élevée là où la matière est abondante et stable, plus faible sur un domaine spécialisé, récent, ou propre à une organisation. Aucun réglage ultérieur ne compense un corpus pauvre sur le sujet qui vous intéresse.

Mise à jour : 20 août 2026