Грубо говоря, некоторая потенциальная перенастройка, которая может произойти в одном дереве (что является причиной, по которой вы вообще обрезаете ветку), смягчается двумя вещами в случайном лесу:
- Дело в том, что образцы, используемые для обучения отдельных деревьев, «загружаются».
- Тот факт, что у вас есть множество случайных деревьев, использующих случайные объекты и, следовательно, отдельные деревья, являются сильными, но не настолько коррелированными друг с другом.
Изменить: на основе комментария ОП ниже:
Там определенно все еще есть потенциал для переоснащения. Что касается статей, вы можете прочитать о мотивации «упаковки в мешки» Бреймана и «начальной загрузки» в целом Эфрона и Тибширани. Что касается 2., Бриман вывел свободную границу ошибки обобщения, которая связана с прочностью дерева и антикорреляцией отдельных классификаторов. Никто не использует границу (скорее всего), но она призвана дать интуитивное представление о том, что помогает уменьшить ошибку обобщения в методах ансамбля. Это в самой газете «Случайные леса». Мой пост должен был подтолкнуть вас в правильном направлении на основе этих чтений и моего опыта / выводов.
- Брейман Л. Предсказатели мешков, машинное обучение, 24 (2), с. 123-140, 1996.
- Эфрон, Б .; Тибширани Р. (1993). Введение в Bootstrap. Бока-Ратон, Флорида
- Брейман, Лев (2001). «Случайные леса». Машинное обучение 45 (1): 5–32.