
118
■
6
章 トピックモデリング
mutate(term = reorder(term, beta)) %>%
ggplot(aes(term, beta, fill = factor(topic))) +
geom_col(show.legend = FALSE) +
facet_wrap(~ topic, scales = "free") +
coord_flip()
4
つのトピックは
4
冊の本に明確に対応しています。「
captain
」、「
nautilus
」、「
sea
」、
「
nemo
」のトピックが『海底二万里』であり、「
jane
」、「
darcy
」、「
elizabeth
」のトピッ
クが『高慢と偏見』であることは間違いありません。「
pip
」、「
joe
」が『大いなる遺産』、
「
martians
」、「
black
」、「
night
」が『宇宙戦争』だということもわかります。そして、
LDA
が「ファジーなクラスタリング」アルゴリズムで
あることを反映して、トピック
1
と
4
の「
miss
」、トピック
3
と
4
の「
time
」のように、複数のトピックに共通する頻出
語も含まれていることがわかります。
6.2.2
文書ごとの分類
この分析の個々の文書は、
1
つの章を表しています。そこで、個々の文書のトピッ
クが何かを知り、章を集めて正しい本を復元したいところです。これは、文書
-
ト
ピック確率のγ を調べればわかります。
chapters_gamma <- tidy(chapters_lda, matrix = "gamma") ...