
192
■
9
章 ケーススタディ:
Usenet
テキストの分析
図9-5 個々のUsenetニュースグループの各トピックに対するγ
文学のテキストを分析したときと同じように、トピックモデリングはラベルがな
くてもテキストに含まれるトピックを探し出すことに成功しています。
ただし、
Usenet
メッセージの分類は、ほかのトピックに対して高い γ値を示す
メッセージが多数含まれており、文学書を章に分けたときと比べてきれいに分類で
きているわけではありません。多くのメッセージが短く、頻出語に重なる部分があ
るので(たとえば、宇宙旅行と電子工学の議論には、共通して含まれる単語が多数
あるはずです)、これは意外なことではないでしょう。これは
LDA
がある程度の重
なり合いを認めながら文書をおおよそのトピックに分類することを示すリアルな例
です。
9.3
センチメント分析
第
2
章で説明したセンチメント分析のテクニックを使えば、これらの
Usenet
グ
ループへの投稿にポジティブな単語、ネガティブ
な単語がどれくらいの頻度で現れ
るかを調べられます。最もポジティブ、あるいはネガティブなニュースグループは
どれでしょうか。
この例では、個々の単語に数値のスコアを与える
AFINN
センチメント辞書を使っ