Expertenmischung (Mixture of Experts)

Ein Modellentwurf, der das Netz in viele spezialisierte Teilnetze aufteilt und pro Eingabe nur wenige aktiviert, sodass ein sehr großes Modell zu den Kosten eines viel kleineren läuft.

Eine Expertenmischung (englisch mixture of experts, MoE) zerlegt ein Modell in viele kleinere „Experten”-Teilnetze samt einem Router, der jede Eingabe nur an wenige davon schickt. Das Modell kann so eine riesige Zahl an Parametern besitzen und dennoch nur einen Bruchteil zugleich aktivieren, was die Rechenkosten pro Anfrage niedrig hält.

Der Preis dafür ist Komplexität: Training und Betrieb von MoE-Modellen sind kniffliger als bei einem einfachen dichten neuronalen Netz. Der Entwurf wurde bei effizienten großen Sprachmodellen prominent, darunter die Systeme hinter DeepSeek-R1.