
7
장
텍스트 데이터 다루기
413
4
장에서 데이터의 속성을 나타내는 두 가지 특성에 관해 이야기했습니다. 정량적인 연속형 특
성과 고정된 목록에서 값이 정해지는 범주형 특성입니다. 많은 애플리케이션에서 사용하는 세
번째 유형의 데이터가 있는데, 바로 텍스트입니다. 스팸 메일 분류를 예로 들면, 이메일의 내용
에 이 분류 작업에 필요한 중요한 정보가 들어 있을 것입니다. 또는 이민 정책에 관한 정치인의
의견을 분석해야 할 때 각자의 언행이나 트윗이 중요한 정보를 제공합니다. 고객 서비스에서는
메시지가 불만사항인지 문의사항인지를 구분해야 할 때가 많습니다. 메시지의 제목이나 내용
으로 고객의 의도를 자동으로 파악해서 적절한 부서로 전달하거나, 완전히 자동으로 응답할 수
도 있습니다.
텍스트 데이터는 주로 글자가 연결된 문자열로 표현됩니다. 텍스트 데이터의 길이는 서로 같은
경우가 거의 없습니다. 이런 특성은 이제까지 본 수치형 특성과 매우 다르므로 머신러닝 알고
리즘에 적용하기 전에 전처리를 해야 합니다.
1
7.1
문자열 데이터 타입
텍스트 데이터를 처리하는 과정으로 들어가기 전에, 자주 나타나는 몇 가지 텍스트 데이터에
1
옮긴이_ 이제까지 본 데이터는 데이터 포인트의 속성이 고정된, 즉 특성의 개수가 같았습니다. 텍스트 데이터는 내용의 길이가 달라지므로