
414
2
fastai 애플리케이션 계층 이해하기
9.8
랜덤 포레스트가 왜 그렇게 잘 작동하는지 원론적인 이유를 다시 한번 생각해봅시다. 각 트리
에 오류가 있지만, 오류끼리는 서로 연관성이 없습니다. 따라서 트리가 적당히 많다면, 이런 오
류의 평균이
0
이 되는 경향이 있죠. 이와 같은 이론을 다른 알고리즘으로 학습된 모델에도 적
용할 수 있습니다. 즉, 각 모델로 평균 예측을 구하는 것이죠.
여기서는 랜덤 포레스트와 신경망이라는 매우 다른 알고리즘으로 학습한 매우 다른 두 모델을
구했습니다. 각각의 오류는 서로 상당히 다를 것이라고 기대할 수 있겠죠. 따라서 이들의 평균
예측이 개별 예측보다 낫다고 예상할 수 있습니다.
앞서 보았듯이 랜덤 포레스트는 그 자체가 앙상블입니다. 하지만 랜덤 포레스트를 단일 모델로
간주하여
앙상블에 편입할 수도 있겠죠. 랜덤 포레스트와 신경망으로 구성된 앙상블 말입
니다! 앙상블이 모델링의 성패를 좌우하지는 않지만, 이미 구축한 모델에 약간 도움이 되는 기
법임은 분명합니다.
여기서 주의해야 할 사항이 있습니다. 파이토치와 사이킷런 모델이 서로 다른 데이터를 출력한
다는 점입니다. 파이토치는 랭크
2
인 텐서 (열이 하나인 행렬 )를, 넘파이는 랭크
1
배열 (벡터)
을 출력하죠. 따라서 모든 텐서의 단위 축
unit
axe ...