Modèle de langage (Language model)
Modèle statistique ou neuronal qui assigne des probabilités à des séquences de mots, utilisé pour la prédiction, la génération et comme socle des systèmes modernes de traitement du langage.
Un modèle de langage estime la probabilité du mot suivant compte tenu du contexte précédent, ou plus généralement la vraisemblance d’une séquence de texte. Les premiers modèles utilisaient des n-grammes de chaînes de Markov : des tables de comptages de mots qui explosent quand le vocabulaire et la longueur du contexte augmentent. Claude Shannon a démontré une génération de texte markovienne simple en 1948, mais les systèmes pratiques ont longtemps lutté avec des données éparses et une généralisation limitée.
Yoshua Bengio et ses collègues ont proposé en 2003 un modèle de langage par réseau de neurones qui apprenait des plongements lexicaux conjointement avec la prédiction du mot suivant, partageant la force statistique entre termes proches. Cette lignée a conduit aux architectures récurrentes et aux Transformeurs, et finalement aux grands modèles de langage actuels qui mettent à l’échelle le même objectif de base sur des milliards de paramètres. Voir l’article sur le modèle de langage neuronal et l’entrée de chronologie.