Modelo de lenguaje

Modelo estadístico o neuronal que asigna probabilidades a secuencias de palabras, usado para predicción, generación y como base de sistemas modernos de PLN.

Un modelo de lenguaje estima la probabilidad de la siguiente palabra dado el contexto anterior, o más en general la verosimilitud de una secuencia de texto. Los primeros modelos usaban cadenas de Márkov n-grama: tablas de conteos de palabras que crecen de forma explosiva cuando aumentan el vocabulario y la longitud del contexto. Claude Shannon demostró generación de texto Markov simple en 1948, pero los sistemas prácticos lucharon durante mucho tiempo con datos dispersos y generalización limitada.

Yoshua Bengio y sus colegas propusieron en 2003 un modelo de lenguaje neuronal que aprendía embeddings de palabras junto con la predicción de la siguiente palabra, compartiendo fuerza estadística entre términos relacionados. Esa línea de trabajo condujo a arquitecturas recurrentes y transformer y, en última instancia, a los grandes modelos de lenguaje actuales, que escalan el mismo objetivo básico a miles de millones de parámetros. Véase el artículo sobre modelos de lenguaje neuronales y la entrada de la cronología.