
7
장
텍스트 데이터 다루기
415
범주를 정의하는 게 최선입니다. 색의 경우라면 “녹색과 빨강 줄무늬” 같은 응답은 “여러 가지
색” 범주에 할당하거나, 다른 것으로 인코딩할 수 없는 값은 “그 외”라고 하면 됩니다. 이런 전
처리는 수작업을 많이 해야 하고 자동화하기 어렵습니다. 데이터 수집 관련 일을 하고 있다면,
범주형 변수로 받을 수 있는 것은 직접 입력받지 말라고 권하고 싶습니다.
미리 정의된 범주에 속하지 않지만 직접 입력한 값들이 주소나 장소, 사람 이름, 날짜, 전화번
호, 식별번호처럼 일정한
구조
를 가지기도 합니다. 이런 종류의 문자열은 분석하기 매우 어렵
고, 처리 방법이 문맥이나 분야에 따라 매우 다릅니다. 이런 경우에 대한 체계적인 처리 방식은
이 책의 범위를 넘는 내용입니다.
문자열 데이터의 마지막 종류는 자유로운 형태의 절과 문장으로 구성된
텍스트 데이터
입니다.
트윗, 채팅, 호텔 리뷰, 셰익스피어 작품, 위키백과 문서, 구텐베르크 프로젝트의
50
,
000
권의
전자책 등이 여기에 속합니다. 이런 데이터는 대부분 단어로 구성된 문장에 정보를 담고 있습
니다.
2
문제를 간단하게 만들기 위해 여기서는 모든 문서가 영어로 쓰였다고 가정하겠습니다.
3
텍스트 분석에서는 데이터셋을 말뭉치
corpus
라 하고, 하나의 텍스트를 의미하는 각 데이터