Atención (Attention)

El mecanismo que deja a un modelo ponderar cuánto importa cada parte de la entrada a cada otra, convirtiendo puntuaciones de similitud en pesos mediante un softmax.

La atención permite a un modelo ponderar cuánto importa cada parte de la entrada a cada otra. Para cada elemento (un token, por ejemplo) se compara con todos los demás, convierte esas puntuaciones en pesos que suman uno (un softmax) y construye una nueva representación como una mezcla ponderada.

Introducida para la traducción y llevada al centro por el transformer en 2017 («Attention Is All You Need»), la autoatención es por qué una palabra como «él» puede mirar atrás al sustantivo al que se refiere. Reemplazó la recurrencia paso a paso de las redes neuronales anteriores por una comparación de todos los pares que corre en paralelo, y subyace a prácticamente todos los grandes modelos de lenguaje modernos.