Atención: mira cómo las palabras deciden a quién escuchar
Haz clic en una palabra y mira los arcos abrirse hacia las demás, más gruesos donde presta más atención, y siempre sumando 100 por ciento. Arrastra palabras para que se atiendan. Es el mecanismo detrás de todo LLM moderno.
La semana pasada una red aprendió a doblar una frontera. Esta semana conocemos la idea que impulsa a ChatGPT y a casi todos los modelos como él, y es sorprendentemente simple: deja que cada palabra mire a todas las demás y decida cuánto escuchar a cada una. Eso es la atención, el corazón palpitante del transformer.
El gadget de abajo es una frase, una palabra por token. Haz clic en una palabra para que sea la que mira alrededor. Los arcos se abren hacia cada otra palabra; cuanto más grueso el arco, más atención presta ahí, y los porcentajes siempre suman 100. Esa última parte es un softmax: un montón de puntuaciones crudas comprimidas en pesos que suman uno.
Prueba esto:
- Haz clic en el pronombre («él»). Mira dónde cae su atención. Ahora arrastra «él» justo al lado de «gato» y mira engrosarse el arco hacia «gato»: el pronombre aprende a mirar atrás a aquello que representa. Es justo el truco que deja a un modelo resolver qué significa «él».
- Arrastra una palabra aparte, sola. Su atención se reparte fina entre todo. Devuélvela al grupo y los pesos vuelven a afinarse.
- Desliza Enfoque. Poco enfoque reparte la atención por igual entre todas las palabras; mucho enfoque hace que cada palabra atienda casi solo a su vecino más cercano. Los transformers reales ajustan esa misma nitidez.
Por qué importa
Durante décadas, los modelos leían el texto paso a paso, pasando un resumen como en el juego del teléfono; las palabras lejanas se perdían con facilidad. En 2017 un artículo con el descarado título «Attention Is All You Need» tiró el paso a paso y conservó solo la atención: cada token se compara con todos los demás en una pasada paralela. Esa arquitectura, el transformer, hizo a los modelos lo bastante escalables como para convertirse en los chatbots y grandes modelos de lenguaje que usamos hoy.
Una nota honesta: un transformer real mide la similitud con un producto escalar de vectores aprendidos, no por cercanía en un lienzo. Aquí usamos la distancia para que puedas guiarlo a mano, pero la forma de la idea es idéntica: puntuar, softmax, mezclar. Detrás de la magia hay una sala llena de palabras, cada una decidiendo en silencio a quién escuchar.
¿Te perdiste las ediciones anteriores? Entrena un perceptrón, mira balbucear a una cadena de Markov, pierde contra el tres en raya invencible, enseña a un filtro a ver bordes, mira a un agente aprender de la recompensa, descubre cómo un modelo lee el texto en tokens, mira uno bajar rodando para aprender, deja que una máquina encuentre grupos sola, o mira una recta aprender a curvarse.