Autojuego
Régimen de entrenamiento en el que un agente mejora compitiendo contra copias o versiones anteriores de sí mismo, generando experiencia diversa sin etiquetas de experto humano.
El autojuego es una estrategia de entrenamiento en aprendizaje por refuerzo en la que un agente juega contra sí mismo o contra instantáneas anteriores de su propia política. Cada partida produce nuevos estados y resultados que sirven como datos de entrenamiento, de modo que el sistema puede mejorar sin un conjunto fijo de movimientos de experto. Como ambos bandos se fortalecen juntos, el autojuego puede explorar estrategias que un profesor humano quizá nunca demostraría y escalar a dominios con espacios de estados enormes.
TD-Gammon de Gerald Tesauro usó autojuego con aprendizaje de diferencia temporal para alcanzar un backgammon cercano al nivel experto a principios de los noventa. Décadas después, AlphaGo combinó autojuego a una escala mucho mayor con redes neuronales profundas y búsqueda en árbol para dominar el Go. Véase el artículo sobre TD-Gammon y el artículo sobre AlphaGo.