
Data Science
290
로 묶을 수 있다. 이 중에서 더 옳은 모델은 없다. 군집 평가에 사용되는 지수가
무엇이냐에 따라 더 최적인 군집이 있을 수는 있지만. 게다가 군집에는 자동적
으로 레이블이 달리지도 않는다.
데이터를 하나하나 개별적으로 들여다 보며 직접 레이블을 달아야 한다.
20.2
모델
각 입력값은 항상 그렇듯 숫자로 구성된
d
-차원 공간의 벡터이다. 우리의 목표는
유사한 입력값끼리 묶어서 군집을 찾고, (때로는) 각 군집에 맞는 대푯값을 찾는
것이다.
예를 들어 사용자들의 블로깅 패턴을 이해하기 위해, 수치형 벡터로 표현된
블로그 포스트의 제목을 군집화해 볼 수도 있다. 또는
RGB
로 된 컬러 이미지 한
장을
10
개의 색만으로 구성된 이미지로 변환해야 한다고 해보자. 군집화를 하면
전체 ‘색 오차’를 최소화할 수 있는
10
가지 색을 고를 수 있게 해줄 것이다.
가장 간단한 군집화 방법 중 하나는 군집의 개수
k
를 미리 정해 두는
k
-
means
이다. 이 알고리즘은 각 데이터 포인트가 속한 군집의 중심점(
mean
)과의 거리
의 제곱 합을 최소화시키며 데이터를
S
1
, ...,
S
k
과 같은 군집으로 나눈다.
n
개의 데이터 포인트를
k
개의 군집으로 할당하는 방법은 아주 다양하다. 바꿔
말하면, 최적의 군집을 찾는 것은 무척 어렵다. ...