
9.2
ニュースグループに含まれる単語
■
185
9.2
ニュースグループに含まれる単語
ヘッダー、シグネチャ、書式を取り除いたら準備完了です。早速頻出語を探って
みましょう。まず、データセット全体、あるいは特定のニュースグループでの頻出
語を調べてみましょう。
usenet_words %>%
count(word, sort = TRUE)
## # A tibble: 68,137
×
2
## word n
## <chr> <int>
## 1 people 3655
## 2 time 2705
## 3 god 1626
## 4 system 1595
## 5 program 1103
## 6 bit 1097
## 7 information 109
4
## 8 windows 1088
## 9 government 1084
## 10 space 1072
## # ... with 68,127 more rows
words_by_newsgroup <- usenet_words %>%
count(newsgroup, word, sort = TRUE) %>%
ungroup()
words_by_newsgroup
## # A tibble: 173,913
×
3
## newsgroup word n
## <chr> <chr> <int>
## 1 soc.religion.christian god 917
## 2 sci.space
space 840
## 3 talk.politics.mideast ...