
1.5
単語の出現頻度
■
9
austen_books()
関数では、最初から分析したいテキストが得られましたが、ヘッ
ダーの著作権情報や書式設定を取り除くなどのクリーニングが必要な場合もありま
す。ケーススタディの章、特に「9.1 前処理」では、この種の前処理の例も紹介し
ます。
1.4
gutenbergr
パッケージ
テキストを整理する方法を説明するために
janeaustenr
パッケージを使ったので、
併 せ て
gutenbergr
パ ッ ケ ー ジ(
Robinson 2016
、
https://github.com/ropenscilabs/
gutenbergr
)も紹介しておきましょう。
gutenbergr
パッケージを使うと、
Project
Gutenberg
コレクション(
https://www.gutenberg.org/
)のパブリックドメイン作品
にアクセスすることができます。このパッケージには、本をダウン
ロードする(こ
のときに邪魔なヘッダーやフッターを取り除きます)ためのツールと、作品にアク
セスする際に使える
Project Gutenberg
メタデータの完全なデータセットが含まれ
ています。本書では、
ID
を指定して
Project Gutenberg
の作品をダウンロードする
gutenberg_download()
関数を使いますが、メタデータについて調べたり、
ID
とタイ
トル、作者、言語などを突き合わせたり、作者についての情報を集めたりすること
ができる関数もあります。
gutenbergr ...