
64
3
章 関連のある文書を見つける
array([33, 22, 17, ..., 14, 11, 39])
>>>
km.labels_.shape
(3414,)
クラスタの中心点は、
km.cluster_centers_
より取得できます。
次の節では、新しい文書に対して、クラスタを決定する方法について見ていきます。
3.4
最初の問題に対する答え
私たちのシステムが新しい文書を分類できるか、確かめましょう。次に示す文書は、
new_post
と
いう変数の中身です。
Disk drive problems. Hi, I have a problem with my hard disk.
After 1 year it is working only sporadically now.
I tried to format it, but now it doesn't boot any more.
Any ideas? Thanks.
先ほど学んだことですが、ラベルを予想する前に、文書をベクトル化しなければなりません。
>>>
new_post_vec = vectorizer.transform([new_post])
>>>
new_post_label = km.predict(new_post_vec)[0]
クラスタリングは既に行っているので、
new_post_vec
を他の全ての文書と比較する必要はありま
せん。その代わりに、同じクラスタに所属する文書だけに集中することができます。それでは、元の
デー