Transformer

L’architecture de réseau de neurones sur laquelle reposent les modèles actuels

L’architecture de réseau de neurones, publiée en 2017, qui a rendu possibles les modèles de langage actuels.

Ce que c’est

Une architecture de réseau de neurones publiée en 2017 par une équipe de chercheurs de Google, qui traite une séquence entière d’un seul tenant plutôt que mot après mot, et pondère l’importance de chaque élément par rapport aux autres.

Pourquoi elle a tout changé

Le traitement d’un seul tenant se répartit sur de nombreux processeurs à la fois. C’est ce qui a rendu praticable l’entraînement sur des corpus considérables, là où les architectures précédentes plafonnaient.

Où le mot se rencontre

Dans le nom même des modèles les plus répandus : le T de GPT désigne cette architecture. Elle sert aujourd’hui bien au-delà du texte — image, son, structures biologiques.

Ce qu’une entreprise doit en savoir

Peu de choses, sinon que les modèles concurrents reposent presque tous sur la même famille d’architecture. Ce qui les distingue tient au corpus, à la taille et au réglage, plus qu’au principe.

Mise à jour : 16 août 2026