
3.3
クラスタリング
63
>>>
print(len(train_data.filenames))
13180
>>>
test_data = sklearn.datasets.load_mlcomp("20news-18828", "test", mlcomp_
root=MLCOMP_DIR)
>>>
print(len(test_data.filenames))
5648
ここでは、問題を複雑にしないために、いつくかのニュースグループに限定して取り組むことにしま
す。そうすれば、実験のサイクルも短くなります。そのために、次に示すように
categories
パラ
メータを用います。
>>>
groups = ['comp.graphics', 'comp.os.ms-windows.misc', 'comp.sys.ibm.
pc.hardware', 'comp.sys.mac.hardware', 'comp.windows.x', 'sci.space']
>>>
train_data = sklearn.datasets.load_mlcomp("20news-18828", "train", mlcomp_
root=MLCOMP_DIR, categories=groups)
>>>
print(len(train_data.filenames))
3414
3.3.3
文書のクラスタリング
すでに気づいていることでしょうが、現実のデータにはノイズが含まれます。このニュースグループ
に関するデ