Mélange d'experts (Mixture of experts)

Une conception de modèle qui divise le réseau en de nombreux sous-réseaux spécialisés et n'en active que quelques-uns par entrée, de sorte qu'un très grand modèle tourne au coût d'un modèle bien plus petit.

Un mélange d’experts (en anglais mixture of experts, MoE) découpe un modèle en de nombreux sous-réseaux « experts » plus petits, accompagnés d’un routeur qui, pour chaque entrée, n’envoie le travail qu’à quelques-uns d’entre eux. Le modèle peut ainsi contenir un nombre énorme de paramètres tout en n’en activant qu’une fraction à la fois, ce qui maintient bas le coût de calcul par requête.

La contrepartie est la complexité : entraîner et servir des modèles MoE est plus délicat qu’un simple réseau de neurones dense. Cette conception s’est imposée dans les grands modèles de langage efficaces, dont les systèmes derrière DeepSeek-R1.