Bosques aleatorios: el conjunto de árboles de decisión de Leo Breiman (2001)
En octubre de 2001 Leo Breiman publicó Random Forests en Machine Learning, combinando muchos árboles de decisión decorrelacionados entrenados sobre muestras bootstrap para crear un clasificador general potente.
En octubre de 2001, Leo Breiman publicó Random Forests en Machine Learning (volumen 45, número 1). El método construye un gran conjunto de árboles de decisión, cada uno entrenado sobre una muestra aleatoria de bagging de los datos y considerando solo un subconjunto aleatorio de características en cada división. Las predicciones se combinan por voto mayoritario o promediado, lo que reduce la varianza respecto a un solo árbol.
Por qué la aleatoriedad ayuda
Un solo árbol de decisión puede sobreajustar el ruido creciendo ramas profundas que memorizan peculiaridades del entrenamiento. Los bosques aleatorios inyectan aleatoriedad a propósito para que los árboles individuales cometan errores distintos. Agregar muchos árboles decorrelacionados suele dar una precisión robusta en datos tabulares sin la ingeniería de características que exigían los primeros sistemas expertos. El enfoque encaja firmemente en el aprendizaje supervisado y el aprendizaje automático clásico, en paralelo a las máquinas de vectores de soporte (artículo).
Antes de la ola del aprendizaje profundo
Los bosques aleatorios se convirtieron en un algoritmo de trabajo en los 2000 para bioinformática, teledetección y analítica empresarial, años antes de que ImageNet y AlexNet hicieran dominante el aprendizaje profundo en visión. Siguen siendo habituales cuando los conjuntos de datos son de tamaño modesto y la interpretabilidad de la importancia de características importa.
Por qué importa
El artículo de Breiman unificó ideas anteriores sobre bagging y subconjuntos aleatorios de características en un método simple y fuerte por defecto. Demostró que el promediado de conjuntos podía igualar o superar modelos únicos complejos, un tema que reapareció después en otros dominios. La fecha de publicación en 2001 lo sitúa en el renacimiento estadístico silencioso entre el segundo invierno de la IA y la era de las redes de creencia profunda (artículo).