
164
■
8
章 ケーススタディ:
NASA
メタデータのマイニング
8.3.1
説明フィールドの単語の
tf-idf
とは何か
ここでは、個々の説明フィールドを文書、説明フィールド全体を文書のコレク
ションまたはコーパスと考えます。この章の前の方ですでに
unnest_tokens()
を
使って説明フィールドに含まれる単語の整理データフレームを作っているので、
bind_tf_idf()
を使えば個々の単語の
tf-idf
を計算できます。
desc_tf_idf <- nasa_desc %>%
count(id, word, sort = TRUE) %>%
ungroup() %>%
bind_tf_idf(word, id, n)
NASA
メタデータ説明フィールドで
tf-idf
が最も高い単語はどれになるでしょう
か。
desc_tf_idf %>%
arrange(-tf_idf) %>%
select(-id)
## # A tibble: 1,913,224
×
6
## word n tf idf
## <chr> <int> <dbl> <dbl>
## 1 rdr 1 1 10.375052
## 2 palsar_radiometric_terrain_corrected_high_res 1 1 10.375052
## 3 cpalsar_radiometric_terrain_corrected_low_res 1 1 10.375052
## 4
lgrs 1 1 8.765615
## ...