
202
■
9
章 ケーススタディ:
Usenet
テキストの分析
単語をポジティブと誤解する原因として最も大きなものは「
don
’
t want/like/
care
」、そしてネガティブと誤分類する最大の原因は「
no problem
」のようです。
9.4
まとめ
この章の
Usnet
メッセージの分析では、
tf-idf
、トピックモデリング、センチメン
ト分析、
n
グラムトークン化など、本書で説明したほぼすべての整理テキストマイ
ニング手法を駆使しました。章全体、いやケーススタディ全体で、データの探索、
可視化のために私たちが使ってきたのは、ごく少数の共通ツールだけです。これら
の例からは、あらゆる整理テキスト分析にとどまらず、あらゆる整理データ分析の
共通点が見えてくるはずです。