Transformer
L’architecture de réseau de neurones sur laquelle reposent les modèles actuels
Ce que c’est
Une architecture de réseau de neurones publiée en 2017 par une équipe de chercheurs de Google, qui traite une séquence entière d’un seul tenant plutôt que mot après mot, et pondère l’importance de chaque élément par rapport aux autres.
Pourquoi elle a tout changé
Le traitement d’un seul tenant se répartit sur de nombreux processeurs à la fois. C’est ce qui a rendu praticable l’entraînement sur des corpus considérables, là où les architectures précédentes plafonnaient.
Où le mot se rencontre
Dans le nom même des modèles les plus répandus : le T de GPT désigne cette architecture. Elle sert aujourd’hui bien au-delà du texte — image, son, structures biologiques.
Ce qu’une entreprise doit en savoir
Peu de choses, sinon que les modèles concurrents reposent presque tous sur la même famille d’architecture. Ce qui les distingue tient au corpus, à la taille et au réglage, plus qu’au principe.
Mise à jour : 16 août 2026
