
120
파이썬 라이브러리를 활용한 머신러닝(번역개정판)
그림
2-34
유방암 데이터로 만든 랜덤 포레스트 모델의 특성 중요도
그림에서 알 수 있듯이 랜덤 포레스트에서는 단일 트리의 경우보다 훨씬 많은 특성이
0
이상의
중요도 값을 갖습니다. 단일 트리의 결과와 마찬가지로 랜덤 포레스트도 “
worst
radius
” 특성
이 매우 중요하다고 보지만, 가장 많은 정보를 가진 특성으로는 “
worst
perimeter
”를 선택했
습니다. 랜덤 포레스트를 만드는 무작위성은 알고리즘이 가능성 있는 많은 경우를 고려할 수
있도록 하므로, 그 결과 랜덤 포레스트가 단일 트리보다 더 넓은 시각으로 데이터를 바라볼 수
있습니다.
장단점과 매개변수
회귀와 분류에 있어서 랜덤 포레스트는 현재 가장 널리 사용되는 머신러닝 알고리즘입니다. 랜
덤 포레스트는 성능이 매우 뛰어나고 매개변수 튜닝을 많이 하지 않아도 잘 작동하며 데이터의
스케일을 맞출 필요도 없습니다.
기본적으로 랜덤 포레스트는 단일 트리의 단점을 보완하고 장점은 그대로 가지고 있습니다. 만
약 의사 결정 과정을 간소하게 표현해야 한다면 단일 트리를 사용할 수 있습니다. 왜냐하면 수
십, 수백 개의 트리를 자세히 분석하기 어렵고 랜덤 포레스트의 트리는 (특성의 일부만 사용하
므로) 결정 트리보다 더 깊어지는 경향도 있기 때문입니다. ...