
■
181
9
章
ケーススタディ:
Usenet
テキストの分析
最後の
9
章では、
1993
年に
Usenet
の
20
のニュ ースグル ー プに送ら れた
20,000
通のメッセージの分析を最初から最後まで紹介しましょう。このデータセットの
Usenet
には、政治、宗教、自動車、スポーツ、暗号学などのテーマを扱うニュース
グループが含まれており、多くのユーザが書いた内容の豊かなテキストセットを提
供しています。このデータセットは、
http://qwone.com/~jason/20Newsgroups/
で
20news-bydate.tar.gz
ファイルとして公開されており、テキスト分析と機械学習の練
習用に広く使われています。
9.1
前処理
まず、
20news-bydate
からすべてのメッセージを読み出します。
20news-bydate
フォ
ルダには、
1
つのメッセージを
1
つのファイルとして格納する複数のサブフォルダが
含まれ
ています。この種のファイルは、
read_lines()
、
map()
、
unnest()
を組み合
わせて読み出すことができます。
文書全体を読み出すこのステップは、数分かかることがあります。
library(dplyr)
library(tidyr)
library(purrr)
library(readr)
training_folder <- "data/20news-bydate/20news-bydate-train/"