Forêt aléatoire (Random forest)
Classifieur d'ensemble qui agrège de nombreux arbres de décision décorrélés entraînés sur des échantillons bootstrap avec des sous-ensembles aléatoires de caractéristiques à chaque scission.
Une forêt aléatoire est une méthode d’ensemble en apprentissage supervisé qui construit de nombreux arbres de décision et combine leurs prédictions par vote majoritaire ou moyenne. Leo Breiman a publié l’algorithme en 2001 ; chaque arbre est entraîné sur un échantillon bootstrap des données par bagging, et à chaque scission seul un sous-ensemble aléatoire de caractéristiques est considéré. Ce hasard injecté décorrèle les arbres de sorte que leurs erreurs individuelles tendent à s’annuler à l’agrégation.
Les forêts aléatoires offrent souvent une forte précision sur des données tabulaires avec peu d’ingénierie de caractéristiques, et elles restent largement utilisées en industrie aux côtés des arbres à gradient boosté. Elles s’inscrivent dans la tradition classique de l’apprentissage automatique qui a prospéré avant que l’apprentissage profond à grande échelle ne domine la vision et le langage. Voir l’article et l’entrée de chronologie.