GAN : quand les réseaux de neurones ont appris à inventer des images (2014)

En juin 2014, Ian Goodfellow et ses collègues ont présenté les réseaux antagonistes génératifs : deux réseaux de neurones entraînés l'un contre l'autre. L'idée a rendu possible la synthèse d'images réalistes et a très tôt soulevé la question des faux.

Date de l'événement: Publié:
HistoireRecherche

En 2014, au pub Les 3 Brasseurs à Montréal, Ian Goodfellow esquisse une idée et la code jusqu’au petit matin. Elle fonctionne du premier coup. Le 10 juin 2014, un article intitulé Generative Adversarial Networks paraît sur arXiv, rédigé par une équipe de huit chercheurs de l’Université de Montréal, dont Yoshua Bengio. Ils présentent les réseaux antagonistes génératifs (GAN) : deux réseaux de neurones entraînés l’un contre l’autre pour que l’un produise des données que l’autre ne puisse distinguer des vraies.

Faussaires contre policiers

Le dispositif associe deux modèles. Un générateur G capture la distribution des données et produit des exemples. Un discriminateur D estime la probabilité qu’un exemple provienne des données d’entraînement plutôt que de G. G est entraîné pour maximiser la probabilité que D se trompe. Les auteurs ont formulé cela comme un jeu minimax à deux joueurs ; dans l’espace de fonctions arbitraires, ils ont montré l’existence d’une solution unique où G retrouve la distribution d’entraînement et D vaut 1/2 partout.

L’analogie de l’article est frappante : G ressemble à une bande de faussaires qui fabrique de la fausse monnaie, D à la police qui tente de la détecter. La compétition pousse les deux camps jusqu’à ce que les faux soient indiscernables de l’argent réel. Lorsque G et D sont des perceptrons multicouches, l’ensemble peut être entraîné par rétropropagation, sans chaînes de Markov ni réseaux d’inférence déroulés. Les premières expériences portaient sur des chiffres manuscrits (MNIST), la Toronto Face Database et CIFAR-10.

Des visages flous au photoréalisme

Les tentatives antérieures de générer des images avec des réseaux de neurones produisaient souvent des résultats flous. Les travaux ultérieurs ont rendu les GAN bien plus convaincants. En novembre 2015, Alec Radford, Luke Metz et Soumith Chintala publient un GAN convolutif profond pour l’apprentissage non supervisé de caractéristiques visuelles. Nvidia génère ensuite des images de célébrités inventées. En décembre 2018, le projet StyleGAN de NVIDIA affiche des visages générés avec la mention « These people are not real ».

Yann LeCun a qualifié les GAN de « the coolest idea in deep learning in the last 20 years ». La trajectoire d’un prototype né dans un pub vers des visages photoréalistes traverse l’apprentissage profond en vision par ordinateur.

Le revers : les faux

Les médias synthétiques ont aussi suscité des alertes précoces. MIT Technology Review cite Hany Farid de Dartmouth : « We’re fundamentally in a weak position. » L’article prévenait que les GAN « didn’t create this problem, but they’ll make it worse ».

Les régulateurs ont réagi. Le règlement européen sur l’IA définit les deepfakes (art. 3, n° 60) et impose aux déployeurs de systèmes qui génèrent ou manipulent de tels contenus de révéler qu’ils sont artificiellement créés ou manipulés (art. 50, paragraphe 4). Voir l’article sur le règlement européen sur l’IA.

Pourquoi c’est important

L’ACM a cité les travaux de Bengio sur les GAN avec Goodfellow lors du prix Turing 2018 et évoqué une révolution en vision par ordinateur et en infographie. En 2021, Dhariwal et Nichol ont montré que les modèles de diffusion pouvaient surpasser les GAN en synthèse d’images, mais l’idée des GAN reste le point de départ de l’IA générative pour les images. À NeurIPS 2024, l’article original a reçu un prix Test of Time aux côtés de Seq2Seq ; il avait alors été cité plus de 85 000 fois.

Deux ans plus tôt, AlexNet avait appris aux réseaux à reconnaître des images ; les GAN leur ont appris à en inventer. La compétition entre générateur et discriminateur continue de façonner notre rapport aux médias réels et synthétiques en ligne.

#apprentissage-profond#reseau-neuronal