
70
4
章 トピックモデル
の手法が、このLDAを基に提案されています。LDAを理解するためには、その背景として複雑な数
学の知識が必要ですが、ここでは詳細には立ち入らないことにします。
興味のある方は、次のWikipediaページを参照してください。LDAアルゴリズムの背景にある数式
について記載されています。
http://en.wikipedia.org/wiki/Latent_Dirichlet_allocation
詳細については省きましたが、このモデルのおおまかなイメージとしては、“文章製造機”のようなも
のがあり、それがこのモデルの背後にあると考えることができます。この文章製造機の中には、固定さ
れたトピックが存在します。少しわかりにくいと思うので、具体例を挙げて考えてみましょう。
たとえば、次の3つのトピックだけがある場合を考えてみましょう。
●
機械学習
●
Python
●
料理
各トピックは関連する単語のリストを持ちま
す。本書は、「機械学習」と「Python」の二つのトピッ
クから構成されると言えるでしょう。もしかしたら、50%ずつそれぞれのトピックについて書かれてい
るかもしれません。もしそうだとすると、私たちが本書を執筆したときに、「機械学習」のトピックが持
つ単語リストから、本書で使われる単語の半分が選び出されたことになります。そして、残り半分の
単語が、「Python」のトピックが持つ単語リストから選び出されます。ちなみに、このモデルでは単語
の順序については考えません。
もちろん、私た ...