
7
장
텍스트 데이터 다루기
427
grid.t(X_train, y_train)
print("최적의 교차 검증 점수: {:.2f}".format(grid.best_score_))
Out [22]:
최상의 교차 검증 점수: 0.89
그리드 서치의 교차 검증 점수는 여전히
89
%로, 이전과 달라지지 않았습니다. 모델 성능은 높
아지지 않았지만 특성의 개수가 줄어서 처리 속도가 빨라지고, 불필요한 특성이 없어져 모델을
이해하기가 쉬워졌습니다.
NOTE
_
CountVectorizer
의
transform
메서드를 훈련 데이터에 없던 단어가 포함된 문서에 적용하면,
어휘 사전에 없기 때문에 그 단어를 무시합니다. 훈련 데이터에 없는 단어에 대해서 무언가 학습한다는 것이
불가능하므로, 분류 작업에서 보통은 문제가 되진 않습니다. 스팸 감지 같은 애플리케이션에서는 어휘 사전
에 없는 단어가 문서에 얼마나 많이 나타나는지를 기록한 특성이 유용할 수 있습니다. 이 기능이 현재
scikit
-
learn
에 없지만 직접 작성하는 것이 아주 어렵지는 않습니다. 적절한 방식을 사용하여 어휘를 제한하지 않으
면 훈련하는 동안 어휘 사전에 없는 단어가 생기지 않습니다.
7.4
불용어
의미 없는 단어를 제거하는 또 다른 방법은 너무 빈번하여 유용하지 않은 단어를 제외하는 것
입니다. 두 가지 방식이 ...