
187
187
6.4 クラスタリング
心点の距離を計算するだけで済むからです。一方、階層的クラスタリングは一般に低速で
す。それは、それぞれの繰り返しの中で、その時点で残っているすべてのクラスタ同士の距
離が必要となるためです。特に、開始時点ではまだインスタンス同士が統合されていないた
め、すべてのインスタンス同士の距離が必要となり、時間がかかります。
k
平均法のようなセントロイドを用いたアルゴリズムが一般的に着目するのは、
k
に良い
値を設定するには、どのようにすればよいか、ということです。
1
つの答えとして、異なる
複数の
k
の値で実験してみて、どの値が最も良い結果を生成するのか、ということを単純に
検証するやり方があります。
k
平均法は探索的データマイニング
†
で利用されることがよく
あるため、アナリストはどちらにせよクラスタリング結果を検証する必要があります。なぜ
なら、探索的データマイニングでは、結果として得られたクラスタが意味をなすのかどうか
を、アナリスト自身が判断する必要があるためです。通常、この過程で適切なクラスタ数も
明らかになります。クラスタが小さすぎたり、あまりに限定的なクラスタが多い場合には、
k
の値を減らすこともありますし、反対にクラスタが大きすぎたり、まとまりがない場合に
は、
k
の値を増やすことを検討する必要があるでしょう。
より客観的な評価のため、アナリストは
k
の値を増やしながら実験を行い、実験の結果得
られたクラスタリング結果の、品質に関するさまざまな指標(インデックスと呼ばれるこ
ともあります)をグラフ化することができます。 ...