
3.6
まとめ
67
り、
bh
以外の単語には識別性がほとんどないことを意味します。以上見てきたように、今回の例では
完璧なクラスタリングは非常に困難であることがわかっていただけたと思います。
しかし、ここでの私たちの目標は、新しい文書と比較しなければならない文書の数を減らすことで
す。結局のところ、訓練データに用いた文書がどのニュースグループに所属するかというこには、特に
関心があるわけではありません。
3.5
パラメータの調整
その他のパラメータについてはどうでしょうか? より良い結果を得るためにパラメータの調整を行
うべきでしょうか?
もちろん、クラスタの数やベクトル化を行う際の
max_features
の値を変更することができます
(自分で試してみましょう!)。また、クラスタを初期化する際に用いる中心点を、別の点で初期化する
ことも可能です。KMeansの他にも魅力的な手法は存在します。また、類似度を算出する
ために、コ
サイン類似度(Cosine similarity)、ピアソン相関係数(Pearson)、Jaccard 係数などを用いることが
できます。多くの選択肢があり自由に試すことができるのは、とても刺激的でしょう。
しかし、その前に「より良い」ということが何を意味するのか、明確に定義する必要があります。
Scikitには、この定義を行うための専用のパッケージが存在します。そのパッケージとはsklearn.
metricsであり、クラスタリングの性能を計測するための多くの評価関数が含まれます。も