
121
121
5.2 オーバーフィッティング
タに含まれない)すべての顧客に対して同じ予測を返します。一見完璧に見えたモデルが、
実際には何の役にも立たないことが明らかになってしまいました。
こんなシナリオは馬鹿らしく思えるかもしれません。実際には、顧客データをそのまま
テーブルに突っ込んで、これが何かの「予測モデル」である、という人などいないでしょ
う。しかし大事なのは、これがなぜまずいやり方かを考えることです。なぜなら、もっと現
実的なデータマイニングをしようとしても同じ理由で失敗することがあるからです。このお
話はデータサイエンスにおいて互いに関連する基本的な考え方、汎化とオーバーフィッティ
ングにまつわる極端な例と言えます。汎化とは、モデルやモデルを立てるプロセスが持つ性
質であり、この性質ゆえに構築の際に使ったデータ以外に対してもモデルを適用することが
できるのです。先の例におけるモデルは、構築のために使ったデータ以外に対しては全く汎
化されていませんでした。トレーニングデータ向けに完璧に合わせ込んである、つまり「適
合(フィット)」しています。もっと言えば「適合しすぎ(オーバーフィット)」ているので
す。
ここは大事なポイントです。すべてのデータセットは、ある母集団から抜き出した有限個
のサンプルです。この場合は、携帯電話の顧客が母集団となります。私たちは、モデルを単
にトレーニングセットに対して適用するだけでなく、そのトレーニングデータのもととなる
母集団に対しても適用できるようにしたいのです。トレーニングデータが実際の母集団を代 ...