
8.3
説明フィールドの
tf-idf
の計算
■
165
データ分析の目標次第では、単語数が非常に少ない説明フィールドはすべて捨て
てしまうとよいかもしれません。
8.3.2
説明フィールドとキーワードのつながり
説明の中でどの単語の
tf-idf
が高いかがわかり、説明に対するキーワードを格納す
るフィールドも手元にあるので、キーワードデータフレームと
tf-idf
データ付きの説
明フィールドの単語データフレームを完全外部結合して、特定のキーワードに対し
て最も
tf-idf
が高い単語を調べてみましょう。
desc_tf_idf <- full_join(desc_tf_idf, nasa_keyword, by = "id")
tf-idf
という指標から見て、
NASA
データセットの一部のキーワード例にとって最
も重要な単語をいくつかプロットしてみましょう。まず、
dplyr
で対象のキーワード
を絞り込み、キーワードごとに
tf-idf
が高い上位
15
語だけを取り出します。そして、
それらの単語を図8-5 のようにプロットします。
desc_tf_idf %>%
filter(!near(tf, 1)) %>%
filter(keyword %in% c("SOLAR ACTIVITY", "CLOUDS",
"SEISMOLOGY", "ASTROPHYSICS",
"HUMAN HEALTH", "BUDGET")) %>%
arrange(desc(tf_idf)) %>%
group_by(keyword) ...