GAN: cuando las redes neuronales aprendieron a inventar imágenes (2014)
En junio de 2014, Ian Goodfellow y sus colegas presentaron las redes generativas adversativas: dos redes neuronales que se entrenan una contra otra. La idea hizo posible la síntesis realista de imágenes y planteó pronto la cuestión de las falsificaciones.
En 2014, en el pub Les 3 Brasseurs de Montreal, Ian Goodfellow esbozó una idea y la programó hasta la madrugada. Funcionó al primer intento. El 10 de junio de 2014 apareció en arXiv el artículo Generative Adversarial Networks, escrito por un equipo de ocho investigadores de la Université de Montréal, entre ellos Yoshua Bengio. Presentaron las redes generativas adversativas (GAN): dos redes neuronales entrenadas una contra otra para que una produzca datos que la otra no pueda distinguir de los reales.
Falsificadores contra policía
El esquema empareja dos modelos. Un generador G captura la distribución de datos y produce muestras. Un discriminador D estima la probabilidad de que una muestra proceda de los datos de entrenamiento y no de G. G se entrena para maximizar la probabilidad de que D se equivoque. Los autores lo plantearon como un juego minimax de dos jugadores; en el espacio de funciones arbitrarias demostraron que existe una solución única en la que G recupera la distribución de entrenamiento y D vale 1/2 en todas partes.
La analogía del artículo es clara: G es como una banda de falsificadores que fabrica billetes falsos, y D la policía que intenta detectarlos. La competición empuja a ambos hasta que las falsificaciones no se distinguen del dinero real. Cuando G y D son perceptrones multicapa, todo el sistema puede entrenarse con retropropagación, sin cadenas de Márkov ni redes de inferencia desenrolladas. Los primeros experimentos usaron dígitos manuscritos (MNIST), la Toronto Face Database y CIFAR-10.
De caras borrosas al fotorrealismo
Los intentos anteriores de generar imágenes con redes neuronales a menudo producían resultados borrosos. El trabajo posterior hizo las GAN mucho más convincentes. En noviembre de 2015, Alec Radford, Luke Metz y Soumith Chintala publicaron una GAN convolucional profunda para aprendizaje no supervisado de rasgos visuales. Nvidia generó después imágenes de celebridades inventadas. En diciembre de 2018, el proyecto StyleGAN de NVIDIA mostró caras generadas con la nota «These people are not real».
Yann LeCun llamó a las GAN «the coolest idea in deep learning in the last 20 years». La línea desde un prototipo de una noche en un pub hasta caras fotorrealistas recorre el aprendizaje profundo en visión por computador.
La otra cara: falsificaciones
Los medios sintéticos también generaron alertas tempranas. MIT Technology Review citó a Hany Farid de Dartmouth: «We’re fundamentally in a weak position.» El artículo advertía que las GAN «didn’t create this problem, but they’ll make it worse».
Los reguladores tomaron nota. El Reglamento de IA de la UE define los deepfakes (art. 3, n.º 60) y exige a los responsables del despliegue de sistemas que generan o manipulan tales contenidos que revelen que son artificialmente creados o manipulados (art. 50, apartado 4). Véase el artículo sobre el Reglamento de IA de la UE.
Por qué importa
La ACM citó el trabajo de Bengio sobre GAN con Goodfellow al conceder el Premio Turing de 2018 y habló de una revolución en visión por computador y gráficos por computador. En 2021, Dhariwal y Nichol mostraron que los modelos de difusión podían superar a las GAN en síntesis de imágenes, pero la idea de las GAN sigue siendo el punto de partida de la IA generativa para imágenes. En NeurIPS 2024, el artículo original recibió un premio Test of Time junto a Seq2Seq; entonces llevaba más de 85.000 citas.
Dos años antes, AlexNet había enseñado a las redes a reconocer imágenes; las GAN les enseñaron a inventar nuevas. La competición entre generador y discriminador sigue marcando cómo pensamos los medios reales y sintéticos en línea.