Aprendizaje por refuerzo (RL)

Aprender políticas mediante recompensas o puntuaciones al interactuar con un entorno: fundamental para juegos, robótica y algunos ajustes de LLM tipo RLHF.

El RL optimiza comportamientos a través de señales de prueba: recompensas tardías dispersas, trampas de exploración vs. explotación, simulaciones.

Gerald Tesauro desarrolló TD-Gammon (1992), un hito temprano que enseñó a una red neuronal a jugar fuerte al backgammon mediante aprendizaje por diferencia temporal y autojuego. Sistemas de juego como AlphaGo y el alignment moderno de LLM usan a veces etapas tipo RL, por ejemplo RLHF con PPO, junto con registros de aprendizaje supervisado.