
130
파이썬 라이브러리를 활용한 머신러닝(번역개정판)
ExtraTreesClassifier
트리 개수를
100
으로 지정하여
cancer
데이터셋을 적용해보겠습니다.
In [11]:
xtree = ExtraTreesClassier(n_estimators=100, n_jobs=-1, random_state=0)
xtree.t(Xc_train, yc_train)
In [12]:
print("훈련 세트 정확도: {:.3f}".format(xtree.score(Xc_train, yc_train)))
print("테스트 세트 정확도: {:.3f}".format(xtree.score(Xc_test, yc_test)))
Out [12]:
훈련 세트 정확도: 1.000
테스트 세트 정확도: 0.972
이 예에서 엑스트라 트리는 랜덤 포레스트와 거의 같은 성능을 냅니다. 엑스트라 트리가 랜덤
포레스트보다 계산 비용이 비교적 적지만 무작위 분할 때문에 일반화 성능을 높이려면 종종 많
은 트리를 만들어야 합니다. 일반적으로 랜덤 포레스트가 더 선호되는 이유입니다.
엑스트라 트리의 특성 중요도를 시각화해보겠습니다. 엑스트라 트리의 특성 중요도는 비교적
랜덤 포레스트와 비슷합니다.
In [13]:
n_features = cancer.data.shape[1]