
156
■
8
章 ケーススタディ:
NASA
メタデータのマイニング
## # A tibble: 6,225 x 2
## # Groups: keyword [6,225]
## keyword n
## <chr> <int>
## 1 EARTH SCIENCE 17896
## 2 ATMOSPHERE 8463
## 3 Oceans 7907
## 4 Project 7452
## 5 Ocean Optics 7438
## 6 Ocean Color 7310
## 7 Nati
onal Geospatial Data Asset 6681
## 8 NGDA 6681
## 9 completed 6452
## 10 ATMOSPHERIC WATER VAPOR 3569
## # ... with 6,215 more rows
「
OCEANS
」と「
Oceans
」のような重複を取り除くために、すべてのキーワードを
小文字か大文字に統一した方がよいでしょう。次のように行います。
nasa_keyword <- nasa_keyword %>%
mutate(keyword = toupper(keyword))
8.2
単語の共起と相関
次のステップでは、第
4
章で説明したように、
NASA
データセットのタイトル、
説明、キーワードで頻繁に共起する単語を調べて
みましょう。次に、これらのフィー
ルドのワードネットワークを調べます。この分析は、たとえばどのデータセットが
相互に関連し合っているのかを知ることができます。 ...