Modelos de lenguaje neuronales: la lucha de Bengio contra la maldición de la dimensionalidad (2003)

En 2003 Yoshua Bengio y sus colegas publicaron A Neural Probabilistic Language Model en el Journal of Machine Learning Research, aprendiendo representaciones distribuidas de palabras para escapar de los límites de las enormes tablas n-grama.

Fecha del evento: Publicado:
HistoriaInvestigación

En 2003, Yoshua Bengio, Réjean Ducharme, Pascal Vincent y Christian Jauvin publicaron A Neural Probabilistic Language Model en el Journal of Machine Learning Research (volumen 3). Una versión anterior apareció en NIPS 2000 (hoy NeurIPS). El modelo predecía la siguiente palabra a partir de una representación vectorial aprendida de las palabras anteriores, atacando la maldición de la dimensionalidad que hace impracticables las enormes tablas de modelos de lenguaje basados en cadenas de Márkov n-grama cuando crece el vocabulario.

Representaciones distribuidas de palabras

En lugar de almacenar un parámetro separado para cada secuencia de palabras posible, la red aprendió embeddings de palabras: vectores densos en los que palabras similares quedan cerca. Una red neuronal combinaba estos vectores para estimar probabilidades sobre el siguiente token. La idea anticipó los LLM modernos, aunque el hardware de 2003 limitaba el tamaño del modelo.

De n-gramas a texto neuronal

Los modelos de lenguaje clásicos basados en cadenas de Márkov, incluidos los conteos n-grama simples que exploró Claude Shannon en 1948, asumen que solo importan las últimas palabras. Eso mantiene la inferencia rápida, pero no puede compartir fuerza estadística entre palabras relacionadas como «gato» y «perro». El enfoque de red neuronal de Bengio reutilizó estructura entre palabras mediante embeddings compartidos, un paso hacia la revolución estadística del procesamiento de lenguajes naturales en los 2000.

Por qué importa

El artículo se cita ampliamente como un hito temprano en los embeddings de palabras y los modelos de lenguaje neuronales. Bengio compartió después el Premio Turing de 2018 con Geoffrey Hinton y Yann LeCun. El trabajo conecta las redes de la era de la retropropagación (artículo) con la era del transformador (artículo), y complementa las redes de creencia profunda del mismo decenio.

#red-neuronal#aprendizaje-profundo