Q-learning : regarde un agent apprendre par la récompense
Lâche un agent dans une grille avec un but et un piège. Il ne sait rien au départ et apprend par essais et erreurs où aller, une récompense à la fois. L'idée derrière AlphaGo et le RLHF.
Cette semaine, la machine apprend à la dure : par essais, erreurs et récompense. Le perceptron a ajusté une ligne, la convolution a filtré des pixels, le morpion a anticipé. L’agent du jour n’a rien de tout cela. On le lâche dans un monde qu’il ne comprend pas et on ne lui dit qu’une chose : certains résultats sont bons, d’autres mauvais.
Le gadget ci-dessous est une minuscule grille. Il y a un départ, un but qui vaut +1 et un piège qui vaut -1. L’agent peut aller en haut, en bas, à gauche ou à droite. Il n’a ni carte ni règles, seulement le souvenir de la récompense qu’a rapportée chaque coup depuis chaque case. Ce souvenir est une table de nombres appelée table Q, et la méthode pour la remplir s’appelle le Q-learning.
Essaie ceci :
- Appuie sur Entraîner. L’agent joue des centaines d’épisodes rapides, en trébuchant surtout au hasard au début. Regarde les cases s’allumer : la valeur se propage à rebours depuis le but, case par case, comme une piste olfactive.
- Les flèches montrent la meilleure estimation actuelle de l’agent sur la direction à prendre depuis chaque case. À mesure que l’entraînement se poursuit, elles s’alignent en un chemin qui atteint le but et évite le piège.
- Appuie sur Lancer l’agent pour le voir suivre ce qu’il a appris. Puis Réinitialise et entraîne de nouveau ; à cause de l’exploration aléatoire, le chemin peut différer à chaque fois.
La récompense est le seul professeur
C’est l’apprentissage par renforcement : aucun exemple étiqueté, aucun humain qui montre la bonne réponse, juste un signal de récompense et beaucoup de pratique. La règle de mise à jour est d’une simplicité trompeuse. Après chaque coup, l’agent pousse son estimation pour cette case et cette direction vers « la récompense que je viens d’obtenir, plus la qualité apparente de la case suivante ». Répète cela des milliers de fois et, à partir d’un simple retour, une politique compétente émerge.
De la grille au Go et aux chatbots
Passe cette idée à l’échelle et elle devient une partie des IA les plus célèbres de la décennie. AlphaGo a atteint un niveau de Go surhumain en combinant recherche, apprentissage par renforcement et jeu contre soi-même, l’histoire racontée dans AlphaGo contre Lee Sedol (2016). La même famille de méthodes, sous la forme du RLHF, sert à régler les chatbots pour qu’ils soient utiles et à entraîner des modèles de raisonnement comme DeepSeek-R1 à réfléchir avant de répondre. Des mondes différents, la même boucle centrale : agir, recevoir une récompense, mettre à jour.
Ton agent de grille est la plus petite version honnête de cette boucle. Il ne sait rien, et la récompense seule lui apprend le chemin.
Tu as manqué les éditions précédentes ? Entraîne un perceptron, regarde une chaîne de Markov babiller, perds contre le morpion invincible ou apprends à un filtre à voir les contours.