
7
장
텍스트 데이터 다루기
457
LDA
와 같은 토픽 모델은 레이블이 없거나, 여기서처럼 레이블이 있더라도 큰 규모의 텍스트
말뭉치를 해석하는 데 좋은 방법입니다.
LDA
는 확률적 알고리즘이기 때문에
random
_
state
매개변수를 바꾸면 결과가 많이 달라집니다. 토픽으로 구별하는 게 도움이 되더라도 비지도 학
습에서 내린 결론은 보수적으로 평가해야 하므로 각 토픽에 해당하는 문서를 직접 보고 직관을
검증하는 게 좋습니다.
LDA
.
transform
메서드에서 만든 토픽이 지도 학습을 위한 압축된 표
현으로 사용될 수도 있습니다. 특별히 훈련 샘플이 적을 때 유용합니다.
33
7.10
요약 및 정리
이번 장에서는 자연어 처리 (
NLP
)의 한 예로 영화 리뷰를 분류하는 애플리케이션을 사용해 텍
스트 처리의 기초적인 내용을 다뤘습니다. 텍스트 데이터를 처리할 때 여기서 소개한 방법들이
좋은 시작점이 될 것입니다. 특히 스팸이나 부정거래 탐지, 감성 분석 같은 텍스트 분류 작업에
서
BOW
표현은 간단하고 강력한 해법입니다. 머신러닝의 많은 경우가 그렇듯이 데이터의 표
현이 자연어 처리 애플리케이션의 핵심이고 추출된 토큰과
n
-그램을 분석하면 모델링 과정에
서 필요한 많은 통찰을 얻게 됩니다. 텍스트 처리 애플리케이션에서는 지도 학습이나 비지도
학습 작업을 위해 이번 ...