Mezcla de expertos (Mixture of experts)
Un diseño de modelo que divide la red en muchas subredes especializadas y activa solo unas pocas por entrada, de modo que un modelo muy grande funciona al coste de uno mucho más pequeño.
Una mezcla de expertos (en inglés mixture of experts, MoE) divide un modelo en muchas subredes «expertas» más pequeñas junto con un enrutador que, para cada entrada, envía el trabajo solo a unas pocas de ellas. Así el modelo puede tener una enorme cantidad de parámetros y activar solo una fracción a la vez, lo que mantiene bajo el coste de cómputo por consulta.
El precio es la complejidad: entrenar y servir modelos MoE es más delicado que una red neuronal densa y simple. El diseño ganó protagonismo en modelos de lenguaje eficientes, incluidos los sistemas detrás de DeepSeek-R1.