← Lexique IA

Multimodalité

Langage, voix & vision

La multimodalité est la capacité d'un modèle à traiter plusieurs types de contenus (texte, image, son, vidéo) dans un même échange : décrire une photo, analyser un document scanné, commenter un graphique. Les modèles de fondation récents sont nativement multimodaux, ouvrant des usages impossibles au texte seul.

En pratique chez Gensai

Gensai combine les modalités selon le projet : voix et texte pour les agents vocaux, image et texte pour l'analyse documentaire.

Aller plus loin que la définition ?

Passer du concept au projet : Gensai conçoit des solutions IA sur mesure, souveraines et conformes au RGPD.

55 boulevard de Strasbourg, 75010 Paris
Informations utilisées uniquement pour répondre à la demande.