Redes de creencia profunda: cuando las redes profundas volvieron a ser entrenables (2006)

En julio de 2006 Geoffrey Hinton y sus colegas mostraron que apilar máquinas de Boltzmann restringidas capa a capa y ajustar el resultado con retropropagación permitía entrenar redes profundas. El resultado ayudó a reactivar el renacimiento del aprendizaje profundo.

Fecha del evento: Publicado:
HistoriaInvestigación

En julio de 2006, Geoffrey Hinton, Simon Osindero y Yee-Whye Teh publicaron A Fast Learning Algorithm for Deep Belief Nets en Neural Computation (volumen 18, número 7). En el mismo mes, Hinton y Ruslan Salakhutdinov mostraron en Science (28 de julio de 2006) que un autoencoder profundo podía comprimir datos de alta dimensión mucho mejor que métodos superficiales. Juntos introdujeron las redes de creencia profunda (DBN): redes neuronales construidas apilando con codicia máquinas de Boltzmann restringidas (RBMs) y luego ajustadas con retropropagación.

Capa a capa, sin gradientes que desaparecen

Entrenar todas las capas de una red profunda a la vez había sido difícil durante mucho tiempo. La receta de 2006 entrenaba una RBM cada vez: cada capa nueva aprendía a modelar los patrones producidos por la inferior. Solo después de este preentrenamiento no supervisado el aprendizaje supervisado ajustaba la pila completa. El artículo de Science demostró el beneficio en parches de imagen y vectores de documentos, reduciendo la dimensionalidad con un error de reconstrucción mucho menor que el análisis de componentes principales.

Un renacimiento, no la última palabra

Los resultados llegaron mientras ImageNet tomaba forma (artículo) y convencieron a muchos investigadores de que la profundidad volvía a ser viable. Otros grupos, entre ellos Yoshua Bengio y colegas, exploraron entrenamiento codicioso capa a capa en el mismo periodo. En pocos años el campo siguió adelante: activaciones ReLU, mejor inicialización, GPUs y grandes conjuntos etiquetados hicieron suficiente la retropropagación de extremo a extremo para modelos como AlexNet, ganador del reto ImageNet en 2012.

Por qué importa

Las redes de creencia profunda fueron un puente: reutilizaron bloques de máquinas de Boltzmann e ideas de cadenas de Márkov de los años ochenta y entregaron una pila entrenada a la misma maquinaria de descenso del gradiente que impulsa hoy la mayor parte del aprendizaje profundo. La citación del Nobel de Hinton remonta a esa línea probabilística. La moda del preentrenamiento decayó, pero la prueba de que las redes profundas podían entrenarse abrió la era que este sitio documenta desde AlexNet.

#red-neuronal#aprendizaje-profundo