
90
1
실전 딥러닝
치가 약간씩 다를 뿐이었죠(그림
1
-
22
). 만약 여러분이 이 데이터로 모델을 구축하는 보험회
사 연구원이라면, 모델이 지금까지 본 적 없는 운전자에 대해서 얼마나 잘 작동할지에 가장 관
심이 있겠죠(보유한 학습용 데이터가 모든 사람을 대변하지는 못하기 때문입니다 ). 대회 개최
자도 학습용 데이터셋과는 다른 사람의 이미지로만 테스트용 데이터셋을 구축하여 제공했습
니다.
그림
1-22
학습용 데이터의 사진 두 장
[그림
1
-
22
]의 두 이미지 중 하나를 학습용 데이터셋에, 다른 하나를 검증용 데이터셋에 포함
시킨다고 가정해보죠. 그러면 모델은 검증용 데이터셋의 이미지로 예측하는 데 어려움을 겪지
않을 것입니다. 즉 완전히 새로운 사람들의 이미지에서보다 더 잘 작동하는 것처럼 보이겠죠.
또 다른 관점은 모델 학습에 모든 사람의 데이터를 사용한다면, 모델은 상태 (스마트폰 사용,
음식 섭취 등 )를 배우지 못하고 특정 사람들의 특성에 과적합될 수 있다는 점입니다.
멸종 위기 어종의 불법 포획을 줄이기 위해 어선별 포획 어종을 식별하는 캐글의 ‘어업 대회
(
https
://
oreil
.
ly
/
iJwFf
)’에서도 유사한 상황을 확인할 수 있습니다. 테스트용 데이터셋
을 구성하는 이미지에는 학습용 데이터셋에서는 나타나지 않았던 어선들이 포함되었죠. 따라 ...