Q-learning: mira cómo un agente aprende de la recompensa

Suelta un agente en una cuadrícula con una meta y una trampa. Empieza sin saber nada y aprende por ensayo y error hacia dónde ir, una recompensa cada vez. La idea detrás de AlphaGo y RLHF.

y26w34

Esta semana la máquina aprende a las malas: por ensayo, error y recompensa. El perceptrón ajustó una línea, la convolución filtró píxeles, el tres en raya miró hacia adelante. El agente de hoy no tiene nada de eso. Lo sueltan en un mundo que no entiende y solo le dicen una cosa: algunos resultados saben bien, otros mal.

El gadget de abajo es una diminuta cuadrícula. Hay un inicio, una meta que vale +1 y una trampa que vale -1. El agente puede moverse arriba, abajo, izquierda o derecha. No tiene mapa ni reglas, solo el recuerdo de lo gratificante que ha resultado cada movimiento desde cada casilla. Ese recuerdo es una tabla de números llamada tabla Q, y el método para rellenarla es el Q-learning.

Prueba esto:

  1. Pulsa Entrenar. El agente juega cientos de episodios rápidos, al principio dando tumbos al azar. Mira cómo se iluminan las casillas: el valor se propaga hacia atrás desde la meta, casilla a casilla, como un rastro de olor.
  2. Las flechas muestran la mejor apuesta actual del agente sobre hacia dónde ir desde cada casilla. A medida que sigue el entrenamiento, se alinean en una ruta que llega a la meta y esquiva la trampa.
  3. Pulsa Ejecutar agente para verlo seguir lo aprendido. Luego Reinicia y entrena de nuevo; por la exploración aleatoria, el camino puede salir distinto cada vez.

La recompensa es el único maestro

Esto es aprendizaje por refuerzo: sin ejemplos etiquetados, sin un humano que muestre la respuesta correcta, solo una señal de recompensa y mucha práctica. La regla de actualización es engañosamente simple. Tras cada movimiento, el agente empuja su estimación para esa casilla y dirección hacia «la recompensa que acabo de recibir, más lo buena que pinta la casilla siguiente». Repítelo miles de veces y, a partir de puro feedback, surge una política competente.

De la cuadrícula al Go y a los chatbots

Escala esta idea y se convierte en algunas de las IA más famosas de la década. AlphaGo alcanzó un Go sobrehumano combinando búsqueda con aprendizaje por refuerzo y autojuego, la historia que se cuenta en AlphaGo contra Lee Sedol (2016). La misma familia de métodos, como RLHF, es la que ajusta a los chatbots para ser útiles y entrena a modelos de razonamiento como DeepSeek-R1 para pensar antes de responder. Mundos distintos, el mismo bucle central: actuar, recibir una recompensa, actualizar.

Tu agente de cuadrícula es la versión honesta más pequeña de ese bucle. No sabe nada, y solo la recompensa le enseña el camino.

¿Te perdiste las ediciones anteriores? Entrena un perceptrón, mira balbucear a una cadena de Markov, pierde contra el tres en raya invencible o enseña a un filtro a ver bordes.

Episodios: 0
Editar:
Inicio Meta (+1) Trampa (-1)
Pulsa Entrenar y mira cómo el agente prueba miles de movimientos. La recompensa (+1 en la meta, -1 en la trampa) le enseña hacia dónde ir; las flechas muestran lo aprendido. Luego pulsa Ejecutar agente. ¿Quieres otro mundo? En Editar, elige Meta, Trampa, Muro o Inicio y haz clic en una casilla; el agente vuelve a aprender desde cero.