
Data Science
170
날 것이며, 모델은 속성 간의 관계보다는 사용자를 분류하도록 학습될 수도 있
다. 큰 문제는 아닐 수 있지만 필자 역시 이런 상황을 겪은 적이 있으니 염두에
두도록 하자.
더욱 큰 문제는 학습 데이터와 평가 데이터로 하나의 모델을 평가할 때가 아
니라 여러 모델 중에서 하나의 모델을 선택할 때 발생한다. 이 경우 각각의 모델
은 오버피팅되지 않겠지만, 평가 데이터에서 성능이 제일 좋은 모델을 선택한다
면 이는 평가 데이터를 일종의 두 번째 학습 데이터로 사용하는 메타 학습의 문
제가 발생한다. 당연히 평가 데이터에서 성능이 제일 좋았던 모델을 동일한 평
가 데이터로 평가한다면 좋은 성능이 나올 수밖에 없다.
이러한 경우, 데이터를 세 종류로 나눠서 사용할 수 있다. 학습 데이터로 모델
을 만들고,
검증 데이터(
validation
set
)를 통해 학습된 여러 모델 중 하나를 선택
하고, 평가 데이터로 최종 모델의 성능을 평가할 수 있다.
11.4
정확도
내가 데이터 과학 관련 일을 하지 않을 때는 취미로 의학 쪽을 분석하고 있다.
그리고 저렴하면서도 아무런 시술이 필요 없는 방법으로, 신생아가 살면서 백혈
병(
leukemia
)에 걸릴지 여부를
98
% 이상의 정확도로 판독할 수 있는 방법을 고
안해 냈다. 변호사에게 문의한 결과, ...