
295
295
10.7 例:株価変動予測のためにニュース記事をマイニングする
ものになるでしょう。
注意:潜在的情報としてのトピック
トピックモデルは一種の潜在的情報です。潜在的情報については 12 章で、映画の
レコメンデーションを例にしてもう少し説明をします。潜在的情報は、一種の中間
物であり、入力と出力の間に差し込まれた、見えない情報のレイヤとみなすことが
できます。テキスト内の潜在的なトピックを見つけることと、映画視聴者の映画に
対する潜在的な「想い」を見つけるためのテクニックは本質的には同じと言えます。
テキストの場合では、単語は姿の見えないトピックにマッピングされ、トピックは
ドキュメントにマッピングされます。このようにすることで、モデル全体はより複
雑になり、学習コストが高くなりますが、より良い結果を得られるようになります。
加えて、後程 12 章で映画のレコメンデーションを例として説明するように、潜在
的情報はそれ自体に意味があり、有用な情報となることもあります。
10.7
例:株価変動予測のためにニュース記事をマイニングする
テキストマイニングにおけるいくつかの問題を説明するため、新たに予測的なマイニング
の課題を取り上げます。この課題では、テキストで記述されたニュース記事から株価の変動
を予測します。大雑把に言ってしまえば、これから行うのはニュースワイヤ
†
で配信された
記事から「株式市場を予測する」ことです。この課題には、テキスト処理や問題の定式化に
関する、多くの共通要素が含まれています。