
from Scratch
167
의 병을 진단하는 데 의사결정나무가 좋은 모델이라고 가정한다면 데이터를 통
해 최적의 의사결정나무를 찾을 수 있을 것이다. 앞으로 이 책에서는 학습시킬
수 있는 다양한 모델을 살펴볼 것이다.
하지만 그전에 기계학습의 기본을 살펴보도록 하자. 이 장에서는 다양한 모델
을 살펴보기 전에 필요한 가장 기본적인 내용을 다뤄볼 것이다.
11.3
오버피팅과 언더피팅
기계학습의 일반적인 문제점은 오버피팅(
overfitting
)이다. 오버피팅이란 만들어
진 모델의 성능이 학습 데이터에서는 좋지만, 기존에 관측한 적이 없는 새로운
데이터에서는 좋지 않은 경우를 의미한다. 이러한 현상은 데이터의
잡음(
noise
)
까지 모델에 학습되거나, 원하는 결과를 예측해 주는 요소가 아닌 다른 요소들
이 학습되기 때문에 발생한다.
반대로
언더피팅(
underfitting
)이란 모델의 성능이 학습 데이터에서도 좋지 않
은 경우를 의미한다. 보통 언더피팅이 발생하면 해당 모델은 문제에 적합하지
않다는 것을 의미하며, 새로운 모델을 찾아봐야 한다.
그림
11
-
1
에서는 표본 데이터에 적합한 세 종류의 다항식 함수를 찾아보았다
(어떻게 찾았는지는 걱정하지 말자. 다른 장에서 곧 다룰 것이다).
그림 11-1
데이터과학2th.indd 167 ...