Multi-armed bandit : explorer ou exploiter ?

Cinq machines à sous cachent des taux de gain différents. Tire toi-même ou fais glisser Explorer et regarde epsilon-greedy apprendre quel bras paie le mieux. Le dilemme classique de l'apprentissage par renforcement en une rangée de leviers.

y26w40

La semaine dernière les mots ont appris qui écouter. Cette semaine la machine fait face à un problème que tout recommender, système pub et agent RL connaît : tu as plusieurs options, tu ignores laquelle est la meilleure, et chaque essai a un coût. Tirer le mauvais levier, c’est rater. Ne jamais essayer de nouveaux leviers, c’est peut-être ne jamais trouver le meilleur. Cette tension s’appelle explorer vs exploiter.

Le gadget ci-dessous est une rangée de cinq bandits manchots, machines à sous vintage. Chacun paie selon un schéma caché. Certains bras sont nuls ; un paie mieux que les autres. Tu peux tirer à la main et sentir ta propre curiosité, ou faire glisser Explorer et laisser epsilon-greedy jouer seul : avec probabilité ε il essaie un bras au hasard (explorer), sinon il reste sur le bras au meilleur taux moyen (exploiter).

Essaie ceci :

  1. Tire chaque bras quelques fois à la main. Les barres montrent ton taux de gain ; les chiffres en dessous, combien de fois tu as tiré. Quel bras semble le meilleur après dix tirs ? Es-tu sûr ?
  2. Mets Explorer à 80 % et appuie sur Auto ×10. Regarde l’agent sauter au hasard, sans s’engager. Puis baisse Explorer à 5 % et auto-joue encore : il martèle le favori actuel, peut-être le mauvais.
  3. Appuie sur Afficher cotes pour voir des barres fantômes pâles, les vrais taux. Combien de récompense as-tu laissé sur la table en explorant trop longtemps ou en exploitant trop tôt ? Cet écart s’appelle le regret, la monnaie des algorithmes bandit.

Pourquoi c’est important

Le multi-armed bandit est l’image la plus nette de l’apprentissage par renforcement quand il n’y a pas de carte à apprendre, seulement des choix et du feedback. Fil d’actu, tests A/B, essais cliniques et IA de jeu posent la même question : dépenser le trafic sur ce qui marche déjà, ou parier sur l’inconnu qui pourrait être mieux ?

Les vrais systèmes utilisent des règles plus malines qu’epsilon-greedy (UCB, Thompson sampling), mais le compromis est identique. AlphaGo a exploré de nouveaux coups en self-play ; le RLHF qui a affiné ChatGPT explore des tournures que les humains pourraient préférer. Ta rangée de cinq leviers, c’est la même boucle en format jouet : agir, observer la récompense, mettre à jour les croyances, décider à nouveau.

Tu as raté les éditions précédentes ? Entraîne un perceptron, regarde une chaîne de Markov bafouiller, perds au morpion imbattable, apprends à un filtre à voir les bords, regarde un agent apprendre de la récompense, vois comment un modèle lit le texte en tokens, regarde une bille rouler en bas pour apprendre, laisse une machine trouver des groupes toute seule, vois une ligne se plier en apprenant, ou regarde des mots décider qui écouter.

Chaque bras paie selon un schéma caché. Tire à la main pour explorer, ou fais glisser Explorer pour l'auto-jeu epsilon-greedy : bas = rester sur le meilleur, haut = essayer au hasard. Regarde les moyennes converger.