
300
10 章 テキスト表現とテキストマイニング
ニュースは乱雑
金融ニュースのコーパスは、いくつかの理由から、実際にはここまでに説明した例よりも
はるかに乱雑です。
まず第 1 の理由として、金融ニュースは決算発表、アナリストの評価(『我々はアップル
社を繰り返し「買い」格付けとしています』)、市場の解説(『今朝の MarketMovers で紹
介された「その他の銘柄」にはライコス社とステープル社が含まれます』)、有価証券報告書、
貸借対照表など、さまざまな記事から構成されていることが挙げられます。記事の中で、企
業は多くの異なる理由によって言及されますし、単一のドキュメント(記事)が、実際には
複数の関連性のない宣伝文から構成されているかもしれません。
次の理由としては、記事がさまざまな形式で提供されることが挙げられます。表形式の
データもあれば、複数段落からなる「その日のトップニュース」形式の場合もあります。記
事の持つ意味の大部分はコンテキストに依存しますが、この本で取り上げるテキスト処理で
はコンテキストを考慮した意味までは扱いません。
最後に挙げる理由として、株式のタグ付けが完璧ではない、というものがあります。記事
の中で実際には言及されていない株式のニュースフィードにもタグが付けられるなど、タグ
は過度に付けられがちです。極端な例を挙げると、アメリカのブロガーであるペレス・ヒル
トンは「頭がおかしい(crazy)」や「最低な気分(disgusting)」ということを表現するの
に、「cray ...