Un modèle Mixture of Experts est découpé en nombreux sous-réseaux spécialisés, les experts. Pour chaque token, un routeur n'en active qu'une petite partie. Le modèle compte ainsi un très grand nombre de paramètres au total, mais n'en mobilise qu'une fraction à chaque calcul : DeepSeek-V3 en compte 671 milliards, dont 37 milliards actifs.
En pratique chez Gensai
L'architecture MoE de modèles comme Mixtral, DeepSeek ou Kimi est prise en compte par Gensai dans le choix d'un modèle open-weight, car elle change les besoins en mémoire et en vitesse.
Dans le même thème
LLM (Large Language Model)SLM (Small Language Model)DLLM (Diffusion Large Language Model)Hallucination (IA)Prompt chainingModèle préentraînéModèle de fondationIA générativeTransformerTokenFenêtre de contextePromptPrompt engineeringContexte (IA)Mémoire (IA)Fine-tuningOpen-weightQuantizationDistillationLoRA (Low-Rank Adaptation)Modèle de raisonnementTempérature (IA)