
■
15
2
章
整理データを使った
センチメント分析
前章では、整理テキスト形式とはどういうことであるかを探究し、単語の出現頻
度の問題を解くためにこの形式がどのように利用できるかを示しました。これを使
うことで、文書に含まれる最頻出語はどれかを分析し、また文書を比較しました。
しかし、この章では話題を変え、意見マイニング(
opinion mining
)あるいはセンチ
メント分析(
sentiment analysis
)について考えることにします。文章を読むとき、人
は言葉が持つ感情的(センチメント)な意図について、ポジティブなものかネガティ
ブなものか、驚きとか嫌悪感といったもっと微妙な意味合いを持つ言葉で表現すべ
きものかといったことを推論します。図 2-1 に示すように、テキストマイニングの
ツールを使えば、プログラムを通じてテキストに含まれる感情的な要素にアプロー
チできます。
整理テキスト
テキスト
集計データ
テキスト
データ
可視化
センチメント
辞書
inner_join
dplyr
group_by
summarize
dplyr
unnest_tokens
tidytext
count
dplyr
ggplot2
dplyr, tidyr
dplyr, tidyr
図2-1 tidytextを使ってセンチメント分析を行う典型的なテキスト分析のフローチャート
テキストのセンチメント分析の方法の
1
つは、テキストを個別の単語の組み合わ
せと考え、テキスト全体の感情内容は個別の単語の感情内容の総和と考えるもので