
126
■
6
章 トピックモデリング
含まれていたと推定されていた単語がかなりあることがわかります。その中でも、
「
love
」や「
lady
」といった単語は、『高慢と偏見』での出現頻度の方が高いために誤分
類されたものです(出現頻度を調べれば確かめることができます)。
それに対し、誤分類された小説には含まれていないのに誤分類された単語がいく
つかあります。たとえば、「
flopson
」は『大いなる遺産』にしか含まれていないこと
が確かめられるのに、『高慢と偏見』クラスタに分類されています。
word_counts %>%
filter(word == "flopson")
## # A tibble: 3
×
3
## document word n
## <chr> <chr> <int>
## 1 Great Expectations_22 flopson
10
## 2 Great Expectations_23 flopson 7
## 3 Great Expectations_33 flopson 1
LDA
アルゴリズムは確率的なので、複数の本に広がりを持つトピックに間違って
飛び込むことがあるのです。
6.3
LDA
のほかの実装
topicmodels
パッケージの
LDA()
関数は、
LDA
アルゴリズムの実装の中の
1
つにす
ぎません。たとえば、
mallet
パッケージ(
Mimno 2013
、
https://cran.r-project.org/
package=mallet
)は、
Java
のテキスト分類ツールの ...