GANs: als neuronale Netze lernten, Bilder zu erfinden (2014)
Im Juni 2014 stellten Ian Goodfellow und Kollegen die Generative Adversarial Networks vor: zwei neuronale Netze, die gegeneinander trainieren. Die Idee machte realistische Bildsynthese möglich und warf früh die Frage nach Fälschungen auf.
2014, in der Montréaler Kneipe Les 3 Brasseurs, skizzierte Ian Goodfellow eine Idee und programmierte sie noch in derselben Nacht bis in die frühen Morgenstunden. Beim ersten Versuch funktionierte sie. Am 10. Juni 2014 erschien auf arXiv das Paper Generative Adversarial Networks, verfasst von einem Team aus acht Forschern der Université de Montréal, darunter Yoshua Bengio. Sie stellten Generative Adversarial Networks (GAN) vor: zwei neuronale Netze, die gegeneinander trainiert werden, sodass eines Daten erzeugt, die das andere nicht von echten unterscheiden kann.
Fälscher gegen Polizei
Der Aufbau koppelt zwei Modelle. Ein Generator G erfasst die Datenverteilung und erzeugt Beispiele. Ein Diskriminator D schätzt die Wahrscheinlichkeit, dass ein Beispiel aus den Trainingsdaten stammt und nicht von G. G wird darauf trainiert, die Fehlerwahrscheinlichkeit von D zu maximieren. Die Autoren fassten das als Minimax-Spiel zweier Spieler auf; im Raum beliebiger Funktionen zeigten sie, dass es eine eindeutige Lösung gibt, in der G die Trainingsverteilung wiederherstellt und D überall gleich 1/2 ist.
Die Analogie im Paper ist eindrücklich: G gleicht einer Fälscherbande, die Falschgeld herstellt, D der Polizei, die es entdecken will. Der Wettstreit treibt beide Seiten, bis die Fälschungen nicht mehr von echtem Geld zu unterscheiden sind. Sind G und D mehrschichtige Perzeptrons, kann das gesamte System mit Backpropagation trainiert werden, ohne Markow-Ketten oder entrollte Inferenznetze. Frühe Experimente nutzten handgeschriebene Ziffern (MNIST), die Toronto Face Database und CIFAR-10.
Vom unscharfen Gesicht zum Fotorealismus
Frühere Versuche, Bilder mit neuronalen Netzen zu erzeugen, lieferten oft unscharfe Ergebnisse. Folgearbeiten machten GANs deutlich überzeugender. Im November 2015 veröffentlichten Alec Radford, Luke Metz und Soumith Chintala ein tiefes Faltungs-GAN für unüberwachtes Lernen von Bildmerkmalen. Nvidia erzeugte später Bilder erfundener Prominenter. Im Dezember 2018 zeigte das StyleGAN-Projekt von NVIDIA generierte Gesichter mit dem Hinweis „These people are not real”.
Yann LeCun nannte GANs „the coolest idea in deep learning in the last 20 years”. Die Linie von einem Kneipen-Prototyp zu fotorealistischen Gesichtern verläuft durch das Deep Learning in der Computer Vision.
Die Kehrseite: Fälschungen
Synthetische Medien lösten früh Alarm aus. Die MIT Technology Review zitierte Hany Farid von Dartmouth: „We’re fundamentally in a weak position.” Der Artikel warnte, GANs hätten das Problem nicht geschaffen, würden es aber verschärfen.
Regulierer reagierten. Die EU-KI-Verordnung definiert Deepfakes (Art. 3 Nr. 60) und verlangt von Betreibern von Systemen, die solche Inhalte erzeugen oder manipulieren, eine Offenlegung, dass sie künstlich erzeugt oder manipuliert wurden (Art. 50 Abs. 4). Siehe den Artikel zur EU-KI-Verordnung.
Warum es wichtig ist
Die ACM nannte Bengios GAN-Arbeit mit Goodfellow bei der Vergabe des Turing Awards 2018 und sprach von einer Revolution in Computer Vision und Computergrafik. 2021 zeigten Dhariwal und Nichol, dass Diffusionsmodelle GANs bei der Bildsynthese übertreffen können, doch die GAN-Idee bleibt der Ausgangspunkt der generativen KI für Bilder. Bei NeurIPS 2024 erhielt das Originalpaper einen Test-of-Time-Award neben Seq2Seq; zu dem Zeitpunkt war es mehr als 85.000 Mal zitiert.
Zwei Jahre zuvor hatte AlexNet Netze gelehrt, Bilder zu erkennen; GANs lehrten sie, neue zu erfinden. Der Wettstreit zwischen Generator und Diskriminator prägt bis heute, wie wir über echte und synthetische Medien online denken.