Retropropagación: cómo las redes neuronales aprendieron de sus errores (1986)
En 1986, David Rumelhart, Geoffrey Hinton y Ronald Williams demostraron que las redes neuronales multicapa entrenadas con retropropagación aprenden sus propias representaciones internas. El método sigue siendo el estándar para entrenar la mayoría de las redes neuronales.
El 9 de octubre de 1986 apareció en Nature (volumen 323) un artículo de cuatro páginas de David Rumelhart y Ronald Williams (Institute for Cognitive Science, University of California, San Diego) y Geoffrey Hinton (Carnegie Mellon University). Describía un procedimiento de aprendizaje llamado retropropagación, en el que unidades internas «ocultas» que no son ni entradas ni salidas aprenden a representar rasgos importantes de la tarea. El algoritmo ajusta repetidamente los pesos para minimizar la diferencia entre la salida real y la deseada, de modo que las redes neuronales aprenden sus propias representaciones internas.
El problema de las capas ocultas
El perceptrón de Rosenblatt (artículo) aprendía ajustando pesos a partir de errores. En 1969, Minsky y Papert demostraron en Perceptrons que los perceptrones de una sola capa no podían representar ciertas funciones (incluido XOR), lo que contribuyó al primer invierno de la IA (artículo). Las redes multicapa podían, en principio, superar esos límites, pero faltaba una forma práctica de entrenar unidades intermedias. Los autores del artículo de Nature señalan que el procedimiento de convergencia del perceptrón simple no puede crear nuevos rasgos por sí solo.
Propagar el error hacia atrás
El método funciona con un paso hacia adelante, una comparación con la salida objetivo y un paso hacia atrás usando la regla de la cadena. La medida de error es la mitad de la suma de desviaciones al cuadrado; los pesos cambian en proporción al gradiente, es decir, mediante descenso del gradiente. Puedes explorar la idea en Geek de la semana: descenso del gradiente y ver la profundidad en acción en Geek de la semana: red neuronal.
En un ejemplo, la red aprendió simetría especular con solo dos unidades ocultas tras 1.425 pasadas por los 64 vectores de entrada posibles. En otro, dos árboles genealógicos isomorfos (nombres en inglés e italiano) se entrenaron con 100 de 104 ternas posibles (persona, relación, persona). Los autores señalan un inconveniente obvio: la superficie de error puede contener mínimos locales, de modo que el descenso del gradiente no garantiza un mínimo global. También escribieron: «The learning procedure, in its current form, is not a plausible model of learning in brains.» (El procedimiento de aprendizaje, en su forma actual, no es un modelo plausible del aprendizaje en el cerebro.)
No fue la primera, pero sí la más influyente
Otros habían desarrollado ideas relacionadas antes. Seppo Linnainmaa publicó en 1970 el «reverse mode» de la diferenciación automática (tesis de máster, Helsinki). Paul Werbos describió el entrenamiento de redes neuronales con retropropagación en su tesis doctoral de 1974 (Harvard) y lo aplicó a redes multicapa en 1982. Los autores de Nature reconocen a David Parker y Yann LeCun como descubridores independientes de variantes. El documento de antecedentes científicos del Nobel de Física 2024 señala que Rumelhart, Hinton y Williams «reinventaron» un esquema que otros ya habían usado; lo decisivo fue demostrar que las redes con capa oculta aprenden tareas imposibles sin ella.
Una versión más extensa apareció el mismo año en Parallel Distributed Processing (MIT Press, 1986). Yann LeCun y colegas usaron después retropropagación para entrenar redes convolucionales con códigos postales manuscritos (1989); a mediados de los años noventa, varios bancos estadounidenses emplearon tales redes para leer dígitos en cheques (artículo).
Por qué importa
La mención del Premio Turing 2018 de la ACM afirma que la retropropagación es hoy estándar en la mayoría de las redes neuronales. AlexNet se entrenó con descenso del gradiente estocástico. Hinton compartió el Premio Nobel de Física de 2024 con John Hopfield. La idea central de 1986, medir el error y empujar cada peso un pequeño paso cuesta abajo, sigue sosteniendo el entrenamiento de la mayoría de los modelos de aprendizaje automático basados en redes neuronales.