Multi-armed bandit: ¿explorar o explotar?

Cinco tragaperras esconden distintas tasas de pago. Tira tú mismo o mueve Explorar y mira epsilon-greedy aprender qué brazo paga mejor. El dilema clásico del aprendizaje por refuerzo en una fila de palancas.

y26w40

La semana pasada las palabras aprendieron a quién escuchar. Esta semana la máquina se enfrenta a un problema que todo recomendador, sistema de anuncios y agente RL conoce de memoria: tienes varias opciones, no sabes cuál es la mejor, y cada intento cuesta algo. Tirar de la palanca equivocada es perder. No probar palancas nuevas es quizá nunca encontrar la mejor. Esa tensión se llama explorar vs explotar.

El gadget de abajo es una fila de cinco bandidos de un brazo, tragaperras clásicas. Cada uno paga según un esquema oculto. Algunos brazos son malos; uno paga mejor que el resto. Puedes tirar a mano y sentir tu propia curiosidad, o mover Explorar y dejar jugar a epsilon-greedy: con probabilidad ε prueba un brazo al azar (explorar), si no se queda con el brazo de mejor media hasta ahora (explotar).

Prueba esto:

  1. Tira de cada brazo unas veces a mano. Las barras muestran tu tasa de acierto; los números debajo, cuántas veces tiraste. ¿Qué brazo parece mejor tras diez tiradas? ¿Estás seguro?
  2. Pon Explorar al 80 % y pulsa Auto ×10. Mira al agente saltar al azar, sin comprometerse. Luego baja Explorar al 5 % y auto-juega otra vez: martilla al favorito actual, quizá el equivocado.
  3. Pulsa Mostrar cuotas para ver barras fantasma tenues, las tasas reales. ¿Cuánta recompensa dejaste sobre la mesa por explorar demasiado o explotar demasiado pronto? Ese hueco es el arrepentimiento (regret), la moneda de los algoritmos bandit.

Por qué importa

El multi-armed bandit es la imagen más clara del aprendizaje por refuerzo cuando no hay mapa que aprender, solo decisiones y feedback. Feeds de noticias, pruebas A/B, ensayos clínicos e IAs que juegan comparten la misma pregunta: ¿gastar tráfico en lo que ya funciona o apostar por lo desconocido que podría ser mejor?

Los sistemas reales usan reglas más listas que epsilon-greedy (UCB, Thompson sampling), pero el trade-off es idéntico. AlphaGo exploró jugadas nuevas en auto-juego; el RLHF que afinó ChatGPT explora formulaciones que los humanos podrían preferir. Tu fila de cinco palancas es el mismo bucle a escala juguete: actuar, observar recompensa, actualizar creencias, decidir otra vez.

¿Perdiste las ediciones anteriores? Entrena un perceptrón, mira babear a una cadena de Markov, pierde contra tres en raya imbatible, enseña a un filtro a ver bordes, mira a un agente aprender de la recompensa, ve cómo un modelo lee texto en tokens, mira una bola bajar la colina para aprender, deja que una máquina encuentre grupos sola, ve una línea doblarse al aprender, o mira palabras decidir a quién escuchar.

Cada brazo paga según un esquema oculto. Tira a mano para explorar, o mueve Explorar para auto-juego epsilon-greedy: bajo = quedarse con lo mejor, alto = probar al azar. Mira cómo convergen las medias.