Multimodal
Un modèle capable de traiter plusieurs formes de contenu à la fois
Ce que le mot recouvre
Un modèle multimodal accepte et produit plusieurs formes de contenu : du texte, des images, du son, de la vidéo, du code informatique. Les premiers modèles ne traitaient que du texte.
Ce que cela change à l’usage
Une photographie de document, une capture d’écran, un enregistrement peuvent être soumis directement, sans transcription préalable. La question et son support voyagent ensemble.
Ce que cela ne garantit pas
Traiter une image n’est pas la comprendre. Les limites du texte demeurent : la réponse reste une production statistique, et une lecture erronée d’un document se présente avec le même aplomb qu’une lecture juste.
Ce qu’il faut vérifier avant d’en faire un usage professionnel
Ce que devient le contenu soumis. Un document confidentiel envoyé à un service en ligne quitte l’entreprise, quelle que soit la forme sous laquelle il est envoyé.
Mise à jour : 16 août 2026
