Descenso de gradiente: mira cómo un modelo aprende cuesta abajo
Suelta una bola en una curva de pérdida y mírala bajar paso a paso. Si la tasa de aprendizaje es muy alta, sale volando; un terreno con baches la atrapa. Así se entrena casi cualquier red neuronal.
Esta semana la máquina hace lo que hay detrás de casi todo el entrenamiento moderno de IA: baja rodando la pendiente. El perceptrón aprendió una línea, pero ¿cómo mejora realmente un modelo? Mide cuánto se equivoca (la pérdida), averigua qué dirección se equivoca menos y da un pequeño paso hacia allí. Repítelo unos miles de millones de veces y habrás entrenado una red.
El gadget de abajo es una zona de juego de descenso de gradiente. La curva es un paisaje de pérdida: los puntos bajos son buenos (poco error), los altos son malos. La bola es el ajuste actual del modelo. En cada paso mira la pendiente bajo sus pies (el gradiente) y baja una cantidad fijada por la tasa de aprendizaje.
Prueba esto:
- Haz clic en cualquier punto de la curva para soltar la bola y pulsa Iniciar. Con una tasa de aprendizaje pequeña en el Cuenco, se desliza suavemente hasta el fondo.
- Ahora sube la tasa de aprendizaje e inicia de nuevo. Si el paso es muy grande, la bola se pasa del valle, rebota cada vez más alto y diverge. Es la razón más común de que un entrenamiento explote.
- Cambia a Colinas y coloca la bola a un lado. Con una tasa suave suele asentarse en el hoyo más cercano, un mínimo local, no el más profundo. Un paso mayor puede sacarla hacia un valle mejor.
Por qué esto es (casi) todo el entrenamiento
Cada peso de una red neuronal es una dimensión de un paisaje como este, solo que el de verdad tiene millones o miles de millones de dimensiones en vez de una. Entrenar significa medir la pendiente en todas a la vez (eso es lo que hace la retropropagación) y dar un paso cuesta abajo. La tasa de aprendizaje con la que acabas de jugar es una perilla real y delicada que todo profesional ajusta.
Esta única idea, ampliada con hardware rápido y muchos datos, es lo que hizo funcionar el aprendizaje profundo: entrenó a AlexNet para ver y al transformer para leer. Detrás de la magia hay una bola, una pendiente y un pequeño paso en la dirección correcta.
¿Te perdiste las ediciones anteriores? Entrena un perceptrón, mira balbucear a una cadena de Markov, pierde contra el tres en raya invencible, enseña a un filtro a ver bordes, mira a un agente aprender de la recompensa o descubre cómo un modelo lee el texto en tokens.