Wort-Embedding (Word embedding)
Dichte Vektorrepräsentation eines Wortes, aus Kookurrenz oder Vorhersagekontext gelernt, die semantische und syntaktische Regularitäten im kontinuierlichen Raum erfasst.
Ein Wort-Embedding ist ein gelerntes dichter Vektor, der die Bedeutung und Verwendung eines Wortes im Kontext repräsentiert. Anders als sparse One-Hot-Kodierungen oder riesige n-Gramm-Tabellen aus Markow-Ketten legen Embeddings verwandte Wörter nahe beieinander in einen kontinuierlichen Raum, sodass das Modell über ähnliche Begriffe generalisieren kann. Yoshua Bengio und Kollegen zeigten 2003, dass ein neuronales Netz als Sprachmodell solche verteilten Repräsentationen beim Vorhersagen des nächsten Wortes lernen kann und damit den Fluch der Dimensionalität älterer zählbasierter Modelle mildert.
Spätere Arbeiten wie word2vec machten das Training von Embeddings in großem Maßstab praktikabel, und die Idee wurde Grundlage moderner maschineller Sprachverarbeitung und heutiger großer Sprachmodelle. Embeddings treiben auch Retrieval-Systeme, die Anfragen mit Dokumenten im Vektorraum abgleichen. Siehe den Artikel zum neuronalen Sprachmodell und den Zeitleisten-Eintrag.