Multimodal

Un modèle capable de traiter plusieurs formes de contenu à la fois

Se dit d’un modèle capable de traiter plusieurs types de contenu — texte, image, audio, vidéo, code — dans un même échange.

Ce que le mot recouvre

Un modèle multimodal accepte et produit plusieurs formes de contenu : du texte, des images, du son, de la vidéo, du code informatique. Les premiers modèles ne traitaient que du texte.

Ce que cela change à l’usage

Une photographie de document, une capture d’écran, un enregistrement peuvent être soumis directement, sans transcription préalable. La question et son support voyagent ensemble.

Ce que cela ne garantit pas

Traiter une image n’est pas la comprendre. Les limites du texte demeurent : la réponse reste une production statistique, et une lecture erronée d’un document se présente avec le même aplomb qu’une lecture juste.

Ce qu’il faut vérifier avant d’en faire un usage professionnel

Ce que devient le contenu soumis. Un document confidentiel envoyé à un service en ligne quitte l’entreprise, quelle que soit la forme sous laquelle il est envoyé.

Mise à jour : 16 août 2026