
9.1
前処理
■
183
coord_flip()
図9-1 各ニュースグループのメッセージ数
Usenet
のニュースグループ名は、階層的な構造になっていることがわかります。
先頭が「
talk
」(雑談)、「
sci
」(科学)、「
rec
」(娯楽)といったメイントピックで、その
あとに具体的な分野が続いています。
9.1.1
テキストの前処理
本書で使ってきたデータセットはほとんどが前処理済みでした。たとえば、
ジェーン・オースティンの小説から著作権表示を取り除く必要はありませんでした。
しかし、
Usenet
のデータセットのメッセージには構造があり、分析に組み込みたく
ない余分なテキストが含まれています。たとえば、各メッセージにはヘッダーが付
いていて、「
from:
」
「
in_reply_to:
」といったフィールドではメッセージについての情
報が記述されています。また、自動的に追加されるメールシグネチャは
--
のような
行から始まります。
この種の前処理は、
dplyr
の
cumsum()
(累積和)と
stringr
の
str_detect()
の組み合
わせですることができます。