
275
10
章
テキスト 表 現と
テキストマイニング
基本コンセプト:
• マイニングフレンドリーなデータ表現構築の重要性
• データマイニングのためのテキスト表現
代表的技法:
• バッグ・オブ・ワード(bag-of-words)
• TFIDF
• N-gram
• ステミング
• 固有表現抽出
• トピックモデル
ここまでの説明では、データマイニングにおいて非常に重要な、あるステージについて
は触れないようにしてきました。それは、どのようにデータを準備するのか、ということ
です。現実世界においては、データは常に特徴ベクトルの形式で提供されるわけではありま
せん。しかしながら、ほとんどのデータマイニングの手法では、特徴ベクトルをインプット
としています。データは通常、それが発生した問題に即した形式で、最も自然に表現されま
す。そのため使い慣れたさまざまなデータマイニングツールを適用したい場合には、ツール
を適用できるようにデータの表現形式を変更したり、その形式に合うような新しいツールを
作ったりする必要があります。一流のデータサイエンティストであれば、そのどちらのやり
方も用います。しかし一般的にシンプルに済ませられるのは、とりあえずデータの表現形式
を既存のツールに合うように変えるやり方の方です。なぜなら、それらのツールはよく知ら
れていて、種類も豊富だからです。
この章では、ある特定の種類のデータにフォーカスします。それはインターネットがさま
ざまな場所で使われるコミュニケーション手段になるにつれて