
186
■
9
章 ケーススタディ:
Usenet
テキストの分析
## 10 talk.politics.mideast armenians 509
## # ... with 173,903 more rows
9.2.1
ニュースグループ内の
tf-idf
ニュースグループによってテーマや用語が異なるという視点からは、頻出語も
ニュースグループによって異なるはずです。
tf-idf
統計量を使ってそれを数量化して
みましょう(図9-2)。
tf_idf <- words_by_newsgroup %>%
bind_tf_idf(word, newsgroup, n) %>%
arrange(desc(tf_idf))
tf_idf
# A tibble: 173,913 x 6
newsgroup word n tf idf
<chr
> <chr> <int> <dbl> <dbl>
1 comp.sys.ibm.pc.hardware scsi 483 0.01761681 1.20397
2 talk.politics.mideast armenian 582 0.00804890 2.30259
3 rec.motorcycles bike 324 0.01389842 1.20397
4 talk.politics.mideast armenians 509 0.00703933 2.30259
5 sci.crypt encryption 410 0.00816099 1.89712