Neuronale Sprachmodelle: Bengios Kampf gegen den Fluch der Dimensionalität (2003)
2003 veröffentlichten Yoshua Bengio und Kollegen A Neural Probabilistic Language Model im Journal of Machine Learning Research und lernten verteilte Wortrepräsentationen, um den Grenzen riesiger n-Gramm-Tabellen zu entkommen.
2003 veröffentlichten Yoshua Bengio, Réjean Ducharme, Pascal Vincent und Christian Jauvin A Neural Probabilistic Language Model im Journal of Machine Learning Research (Band 3). Eine frühere Version erschien auf NIPS 2000 (heute NeurIPS). Das Modell sagte das nächste Wort aus einer gelernten Vektordarstellung der vorherigen Wörter vorher und griff den Fluch der Dimensionalität an, der riesige Tabellen für Sprachmodelle aus n-Grammen von Markow-Ketten bei wachsendem Vokabular unpraktikabel macht.
Verteilte Wortrepräsentationen
Statt für jede mögliche Wortsequenz einen eigenen Parameter zu speichern, lernte das Netz Wort-Embeddings: dichte Vektoren, in denen ähnliche Wörter nahe beieinander liegen. Ein neuronales Netz kombinierte diese Vektoren, um Wahrscheinlichkeiten über das nächste Token zu schätzen. Die Idee wies moderne große Sprachmodelle voraus, doch die Hardware von 2003 begrenzte die Modellgröße.
Von n-Grammen zu neuronalem Text
Klassische Sprachmodelle auf Basis von Markow-Ketten, darunter einfache n-Gramm-Zählungen, die Claude Shannon 1948 untersuchte, setzen voraus, dass nur die letzten wenigen Wörter zählen. Das hält die Inferenz schnell, kann aber keine statistische Stärke zwischen verwandten Wörtern wie „Katze” und „Hund” teilen. Bengios Ansatz mit einem neuronalen Netz nutzte Struktur über Wörter hinweg durch gemeinsame Embeddings, ein Schritt zur statistischen Revolution der maschinellen Sprachverarbeitung in den 2000er-Jahren.
Warum es wichtig ist
Das Paper gilt weithin als früher Meilenstein bei Wort-Embeddings und neuronalen Sprachmodellen. Bengio teilte später 2018 den Turing Award mit Geoffrey Hinton und Yann LeCun. Die Arbeit verbindet Netze der Ära der Backpropagation (Artikel) mit dem Zeitalter des Transformer (Artikel) und ergänzt Deep Belief Networks aus demselben Jahrzehnt.