
158
6 章 類似度、近傍、クラスタ
このリストを使えば、ブナハーブンに似たスコッチを見つけることができるでしょう。店
によっては在庫のあるなしでリストを少し下へたどる必要があるかもしれませんが、このリ
ストは似ている順でスコッチが並んでいるため、在庫がある中で最も似たスコッチを探すこ
とは簡単です(また、手に入る中で一番似ているスコッチと、入手できなかった他のスコッ
チにどれぐらい違いがあるかということも何となくわかるでしょう)。
以上が類似度を直接的に利用して問題を解決する一例です。一度この基本的な考え方を理
解してしまえば、これまで挙がっていたようなさまざまな問題(似た企業を探す、似た顧客
を探すなど)に立ち向かうための強力な道具を手に入れたも同然です。ウィスキーの例で見
たように、データサイエンティストが実際にデータを定義して、意味のある特徴セットに
ついて類似度がきちんと求められるようにする、といった部分までこなすこともよくありま
す。では次に、データサイエンスにおける類似度の使われ方としてこれまた一般的な別の事
例を見ていきましょう。
6.2.2
予測モデリングのための最近傍
最近傍の考え方を使えば、予測モデリングもこれまでとは違う方法で行うことができま
す。その前に少し時間を取り、これまでの章で予測モデリングについて学んだことをいろい
ろと思い出してから次へ進んでください。類似度を使った予測モデリング、その基本的な方
法は美しいほどにシンプルです。ある新たなサンプルが与えられ、その目的変数の値を予 ...