
7.3
使用している単語の比較
■
135
7.3
使用している単語の比較
それぞれのツイート全体における単語の出現頻度をそのままの形で比較したグラ
フを作りましたが、今度は対数オッズ比を使ってそれぞれのアカウントで比較的よ
く使われる単語がどれかを調べてみましょう。まず、これからは分析対象を
2016
年
に送られたツイートだけに制限します。
2016
年は、デビッドが
1
年を通じて
Twitter
をアクティブに使うようになっていた時期であり、ジュリアがキャリアをデータサ
イエンスに移行した時期です。
tidy_tweets <- tidy_tweets %>%
filter(timestamp >= as.Date("2016-01-01"),
timestamp < as.Date("2017-01-01"))
次に、
str_detect()
を使って
word
列から
Twitter
ユーザ名を取り除きます。こう
しないと、ジュリアかデビッドの片方が知っていてもう片方が知らない人の名前だ
けで結果が埋め尽くされてしまいます。ユーザ名を取り除いたあとで、それぞれが
個々の単語を何回ずつ使ったかを数え、使用頻度が
10
回未満の単語を取り除きま
す。
spread()
操作を行ったら、次の式を使って個々の単語の対数オッズ比を計算す
ることができます。
対数オッズ比 =
log
(
[
n
+
1
]
デビッド総計+
1
)
[
n
+
1
]
ジュリア
総計+
1
ここで、
n
はそれぞれがその単語を何回使ったかを示し、
total
(総計)はそれぞれ
が使った単語の総数を示します。 ...