
関連のある文書を見つける
45
3
章
クラスタリング:
関連のある文書を見つける
前章では、データ点についてクラスやカテゴリを見つける方法について学びました。前章で使用し
た訓練データには、各データに属するクラスが付随しており、その訓練データからモデルを学習しまし
た。そして、新しいデータが与えられたときは、そのモデルを用いて分類を行いました。そこで行った
ことは「教師あり学習」と呼ばれます。名前の所以は、訓練データを教師によって与えらた助言とみな
し、そのガイドをもとに学習を行うことから来ています。ここで、教師は正しい分類を行うことができ
ると仮定しています。
前章ではラベル付けされたデータを用いてクラス分類モデルを学習しましたが、本章ではラベル付
きデータが入手できない状況を考えてみたいと思います。たとえば、ラベル付きデータを集めるのに、
とてもコストがかかる場合などが考えられます。そのような場合、どのように対処することができるで
しょうか
?
もちろん、クラス分類モデルを学習することは無理だと思うかもしれません。それでも、ラベル付け
されていないデータだけから、あるパターンを見つけることは可能です。本章のテーマは、そのような
こと、つまり、データだけからパターンを見つけることです。本章では、Q&A サイトを運営する場面
を想定し、そこで直面する問題について考えることにします。このQ&Aサイト内では、ユーザが探し
ている情報について検索すると、サーチエンジンがそれに相応しと思われるページ
―
「質問」とそれ
に対す