
■
105
6
章
トピックモデリング
テキストマイニングでは、ブログ投稿や新聞記事といった文書のコレクションを
使うことがよくあります。こういったコレクションの内容は、自然なグループに分
類してグループごとに理解するようにしたいところです。トピックモデリングはそ
のような文書を教師なしで分類する方法で、数値データのクラスタリングとよく似
ています。何を探しているのかがはっきりしないときでも、要素の自然な分類方法
を探していきます。
潜在的ディリクレ配分法(
Latent Dirichlet Allocation
、
LDA
)は、特に広く使われ
ているトピックモデリングの手法です。
LDA
は、この種の文書をトピックの組み合
わせ、個々のトピックを単語の組み合わせとして扱います。このようにすると、文
書を別々のグループに厳格に分けてしまうのではなく、内容から見て文書が互いに
「重なり合う」ことを認められるようになります。自然
言語の一般的な使い方を反映
した方法だと言うことができるでしょう。
図6-1 が示すように、整理テキスト原則に従い、本書で今まで使ってきたのと同
じ整理ツールセットを使えば、トピックモデリングにもアプローチできます。この
章では、
topicmodels
パッケージ(
https://cran.r-project.org/package=topicmodels
)の
LDA
オブジェクトの操作方法を学びます。特に、モデルを整理して
ggplot2
や
dplyr
で操作できるようにすることに力を注ぎます。また、複数 ...