
174
■
8
章 ケーススタディ:
NASA
メタデータのマイニング
図8-8 NASAメタデータ説明フィールドをトピックモデリングして得られた確率分布
まず、
y
軸が対数スケールでプロットされていることに注意してください。こう
しなければ、プロットで何かを示すこと自体が難しくなってしまいます。次に、γ
が
0
から
1
までになっていることに注意してください。これは特定の文書が特定の
トピックに属する確率だということを思い出しましょう。
0
の近くに多くの値があ
りますが、それはそのトピックに属さない文書がたくさんあることを示しています。
同様に、γ=
1
の近くにも多くの値があります。これらは文書が実際にそのトピック
に属していることを示しています。この分布は、文書がトピックに属するか属さな
いかをはっきり分類できていることを示しています。図 8-9 のように、トピックご
とに文書がそのトピックに属するかどうかを確認することもできます。
ggplot(lda_gamma, aes(gamma, fill = as.factor(topic))) +
geom_histogram(show.legend = FALSE) +
facet_wrap(~ topic, ncol = 4) +
scale_y_log10() +
labs(title = "Distribution of probability for each topic",
y = "Number of documents", x = expression(gamma)) ...