AlphaGo contre Lee Sedol : la machine qui a appris à jouer (2016)
AlphaGo de DeepMind a battu 4–1 l'un des plus grands joueurs de Go, non par recherche en force brute comme Deep Blue, mais par une intuition apprise des données et du jeu contre lui-même.
En mars 2016, dans un hôtel de Séoul, AlphaGo de DeepMind a battu Lee Sedol, l’un des plus forts joueurs de Go de sa génération, quatre parties à une. Des dizaines de millions de personnes ont suivi en direct, surtout en Asie de l’Est, où le Go est tenu pour un art intellectuel sérieux.
Le résultat comptait parce que le Go passait pour hors d’atteinte. Le plateau est si grand que le nombre de parties possibles éclipse celui des atomes de l’univers observable. On ne peut pas gagner en explorant chaque coup, comme l’avait fait Deep Blue aux échecs en 1997.
Comment AlphaGo a gagné
AlphaGo n’a pas surpassé Lee Sedol au calcul. Il a appris à juger les positions comme le font les forts joueurs, à l’instinct, puis a cherché sélectivement autour de ces jugements.
- Il a d’abord étudié une grande base de parties humaines par apprentissage profond, bâtissant des réseaux de neurones capables de prédire de bons coups et d’estimer qui menait.
- Il s’est ensuite amélioré par apprentissage par renforcement, jouant des millions de parties contre des versions de lui-même et gardant ce qui marchait.
- Enfin, il a combiné ces instincts appris à une recherche arborescente ciblée, ne dépensant son calcul que sur les lignes jugées prometteuses par les réseaux.
Les coups dont on se souvient
Deux moments sont devenus célèbres. Dans la deuxième partie, AlphaGo a joué le coup 37, une frappe d’épaule si inhabituelle que les commentateurs professionnels ont cru à une erreur, avant qu’il ne se révèle décisif. Puis, dans la quatrième partie, Lee Sedol a répondu par le coup 78, un coin si précis qu’AlphaGo a perdu pied et, finalement, la partie. Ce fut la seule partie qu’un humain gagnerait dans le match, et on s’en souvient comme d’un moment de génie humain sous pression.
Pourquoi c’est important
Là où Deep Blue avait cherché, AlphaGo a appris. Toute la différence est là. Une fonction d’évaluation fragile, réglée à la main, a été remplacée par une intuition distillée des données et du jeu contre soi-même, exactement la recette qu’AlexNet avait montrée efficace pour la vision, désormais appliquée à la stratégie.
L’approche s’est généralisée. Son successeur, AlphaGo Zero, a appris le Go de zéro sans aucune partie humaine, et des systèmes ultérieurs ont étendu la même idée de jeu contre soi-même aux échecs, au shogi et au-delà. AlphaGo n’a pas seulement gagné un jeu de plateau ; il a montré qu’une intuition apprise pouvait battre des experts humains sur des tâches longtemps jugées proprement humaines.