
2
장
지도 학습
73
을 만들어 냅니다. 이웃을 많이 사용하면 훈련 데이터에는 잘 안 맞을 수 있지만 더 안정된 예
측을 얻게 됩니다.
장단점과 매개변수
일반적으로
KNeighbors
분류기에 중요한 매개변수는 두 개입니다. 데이터 포인트 사이의 거
리를 재는 방법과 이웃의 수입니다. 실제로 이웃의 수는
3
개나
5
개 정도로 적을 때 잘 작동하
지만, 이 매개변수는 잘 조정해야 합니다. 거리 재는 방법을 고르는 문제는 이 책에서 다루지
않습니다만, 기본적으로 여러 환경에서 잘 동작하는 유클리디안 거리 방식을 사용합니다.
8
k
-
NN
의 장점은 이해하기 매우 쉬운 모델이라는 점입니다. 그리고 많이 조정하지 않아도 자주
좋은 성능을 발휘합니다. 더 복잡한 알고리즘을 적용해보기 전에 시도해볼 수 있는 좋은 시작
점입니다. 보통 최근접 이웃 모델은 매우 빠르게 만들 수 있지만, 훈련 세트가 매우 크면 (특성
의 수나 샘플의 수가 클 경우 ) 예측이 느려집니다.
k
-
NN
알고리즘을 사용할 땐 데이터를 전
처리하는 과정이 중요합니다 (
3
장 참고 ).
9
그리고 (수백 개 이상의 ) 많은 특성을 가진 데이터
셋에는 잘 동작하지 않으며, 특성 값 대부분이
0
인 (즉 희소한 ) 데이터셋과는 특히 잘 작동하
지 않습니다.
k
-최근접 이웃 알고리즘이 이해하긴 쉽지만, 예측이 느리고 많은 특성을 ...