Random Forests: Leo Breimans Ensemble aus Entscheidungsbäumen (2001)
Im Oktober 2001 veröffentlichte Leo Breiman Random Forests in Machine Learning und kombinierte viele entkorrelierte Entscheidungsbäume, die auf Bootstrap-Stichproben trainiert wurden, zu einem leistungsfähigen Allzweck-Klassifikator.
Im Oktober 2001 veröffentlichte Leo Breiman Random Forests in Machine Learning (Band 45, Heft 1). Die Methode baut ein großes Ensemble aus Entscheidungsbäumen, von denen jeder auf einer zufälligen Stichprobe der Daten trainiert wird, die per Bagging gezogen ist, und bei jedem Split nur eine zufällige Teilmenge der Merkmale berücksichtigt. Vorhersagen werden per Mehrheitsentscheid oder Mittelwert kombiniert, was die Varianz gegenüber einem einzelnen Baum verringert.
Warum Zufälligkeit hilft
Ein einzelner Entscheidungsbaum kann Rauschen überanpassen, wenn er tiefe Äste wachsen lässt, die Trainingseigenheiten auswendig lernen. Random Forests injizieren absichtlich Zufall, damit einzelne Bäume unterschiedliche Fehler machen. Die Aggregation vieler entkorrelierter Bäume liefert oft robuste Genauigkeit auf tabellarischen Daten, ohne das Merkmals-Engineering, das frühe Expertensysteme verlangten. Der Ansatz steht fest im überwachten Lernen und im klassischen maschinellen Lernen, parallel zu Support-Vektor-Maschinen (Artikel).
Vor der Deep-Learning-Welle
Random Forests wurden in den 2000er-Jahren zum Standardalgorithmus in Bioinformatik, Fernerkundung und Business Analytics, Jahre bevor ImageNet und AlexNet tiefes Lernen in der Bildverarbeitung dominierten. Sie bleiben verbreitet, wenn Datensätze moderat groß sind und die Interpretierbarkeit der Merkmalswichtigkeit zählt.
Warum es wichtig ist
Breimans Paper vereinte frühere Ideen zu Bagging und zufälligen Merkmalsmengen zu einer einfachen, starken Standardmethode. Es zeigte, dass Ensemble-Mittelung einzelne komplexe Modelle erreichen oder übertreffen kann, ein Motiv, das später in anderen Domänen wieder auftauchte. Das Erscheinungsdatum 2001 ordnet die Arbeit in die stille statistische Wiederbelebung zwischen dem zweiten KI-Winter und der Ära der Deep Belief Networks ein (Artikel).