Máquinas de Boltzmann: cuando las redes neuronales tomaron prestada la física estadística (1985)

En 1985 David Ackley, Geoffrey Hinton y Terrence Sejnowski publicaron un algoritmo de aprendizaje para máquinas de Boltzmann: unidades binarias estocásticas, una función de energía de la física y un muestreo lento que métodos posteriores intentaron evitar.

Fecha del evento: Publicado:
HistoriaInvestigación

En 1985, David Ackley, Geoffrey Hinton y Terrence Sejnowski publicaron A Learning Algorithm for Boltzmann Machines en Cognitive Science (volumen 9, número 1). Describieron una máquina de Boltzmann: una red neuronal de unidades binarias estocásticas cuyo estado colectivo sigue una función de energía tomada de la física estadística, con probabilidades dadas por la distribución de Boltzmann. La red podía aprender representaciones ocultas, pero el entrenamiento dependía de un muestreo lento con cadenas de Márkov, un coste que las redes generativas adversativas posteriores buscaron evitar.

De las redes Hopfield a la estructura oculta

El trabajo se apoyó en las redes de memoria asociativa de John Hopfield de 1982, que almacenan y recuperan patrones mediante un paisaje de energía. Hinton y Sejnowski ya habían vinculado la inferencia perceptual con esas ideas en 1983. El algoritmo de 1985 añadió unidades ocultas para que la red descubriera estructura en los datos en lugar de solo completar patrones parciales. El comité del Nobel citó la máquina de Boltzmann de Hinton al concederle el Premio Nobel de Física de 2024 junto con Hopfield.

Unidades estocásticas y aprendizaje lento

Cada unidad alterna entre estados activo e inactivo con probabilidades que dependen de sus entradas y de la energía global. El aprendizaje ajusta las conexiones para que los patrones de entrenamiento sean estados probables. En la práctica, estimar las estadísticas necesarias exige un prolongado muestreo con MCMC basado en cadenas de Márkov: fijar unidades visibles a los datos y dejar que la red se estabilice, lo que hacía difícil escalar las máquinas de Boltzmann completas.

Máquinas restringidas y divergencia contrastiva

Paul Smolensky describió en 1986 un harmonium relacionado, precursor de la máquina de Boltzmann restringida (RBM), que prohíbe conexiones dentro de una capa para hacer la inferencia más tratable. Durante años las RBM fueron difíciles de entrenar hasta que Hinton introdujo la divergencia contrastiva en 2002, una aproximación más rápida que convirtió las RBM en bloques prácticos. RBM apiladas se convirtieron después en base de las redes de creencia profunda (artículo).

Por qué importa

Las máquinas de Boltzmann mostraron que el aprendizaje no supervisado puede extraer rasgos mediante modelos de energía probabilísticos, no solo mediante retropropagación supervisada. El cuello de botella del muestreo motivó alternativas como redes de inferencia desenrolladas y GAN. La idea de tomar formalismos de la física y de que la generación sin atajos puede ser dolorosamente lenta sigue marcando el aprendizaje profundo actual.

#red-neuronal#aprendizaje-profundo