
from Scratch
237
경우에는 이마저도 어려울 수 있다.) 더 중요한 문제 중 하나는, 의사결정나무는
새로운 데이터에 대한 일반화 성능이 좋지 않게 오버피팅되기 쉽다. 이 문제들
을 해결하는 방법들에 대해서도 이 장에서 살펴볼 것이다.
많은 사람들은 의사결정나무를 범주형 결과를 반환하는
분류나무(
classifica
-
tion
tree
)와 숫자형 결과를 반환하는 회귀나무(
regression
tree
)로 나눈다. 이 장
에서 우리는 분류나무를 중점적으로 살펴보면서, 클래스 레이블이 있는 데이터
로
ID3
알고리즘
2
이 어떻게 의사결정나무를 구축하는지 살펴볼 것이다. 문제
를 간단하게 하기 위해 여기서는 ‘내가 이 후보자를 뽑아야 할까?’, ‘웹사이트에
광고
A
와 광고
B
중 어떤 것을 내보내야 할까?’, 또는 ‘사무실 냉장고에 있던 이
음식을 먹으면 배탈이 날까?’ 등과 같이 결괏값이 이진(
binary
)인 경우만 고려
하자.
17.2
엔트로피
의사결정나무를 만들기 위해서는 어떤 질문을 물을 것이고 어떤 순서로 질문을
던질 것인지 정해야 한다. 나무의 각 단계에서는 데이터에 대한 가능성이 완전
히 배제되는 경우가 있고 그렇지 않은 경우도 있다. 예를 들어 동물의 다리가 다
섯 개 이하라면, 그 동물이 메뚜기일 가능성은 없지만 오리일 가능성은 있다. ...