第3章. 表形式データの説明可能性
この作品はAIを使って翻訳されている。ご意見、ご感想をお待ちしている:translation-feedback@oreilly.com
ディープラーニングの成功の多くは、画像、テキスト、音声、動画などの非構造化データに焦点を当てている。しかし、実運用されている機械学習モデルの大部分は、表形式のデータを念頭に置いて構築されている。リレーショナルデータベースやスプレッドシートに含まれる、数値やカテゴリカルな特徴セットで構成されたデータを思い浮かべてほしい。これらは構造化データの例であり、実際のAIユースケースの大部分を占めている。この章では、シャプレー値、並べ替え特徴の重要度、ツリー・インタプリタ、部分依存プロットの様々なバージョンなど、表形式データを扱うときに最もよく使われる説明可能性テクニックを検証する。
順列 特徴の重要性
ここでは、順列特徴の重要性について知っておく必要があることを説明する:
-
一旦モデルがトレーニングデータ( )に適合されると、1つの特徴に対する並べ替え重要度は、その特徴値がランダムにシャッフルされたときのモデルスコアの減少を測定する。
-
ある特徴()の値をシャッフルすることで、その特徴を使って意味のある予測をするモデルの能力を破壊することになる。もしモデルの予測値が低下し、モデルスコアが大幅に悪化するのであれば、その特徴によって提供される情報は、予測を行う際にモデルにとって重要であったに違いない。一方、モデルスコアの変化がごくわずかであれば、その特徴はそれほど重要ではないことになる。
| 長所 | 短所 |
|---|---|
|
|
Permutation featureimportanceは、表データセットによく使われる摂動ベースの特徴属性テクニックである(特徴属性と摂動テクニックについては第2章参照)。一般的なパターンは、モデル特徴に摂動が加えられたり、何らかの変更が加えられたりした後、これらの新しい例で予測が行われる。この新しい摂動された例のコレクションからのモデル予測を使って、モデルの予測がどのように変化するかを見ることによって、各特徴が予測に与える影響を決定することができる。
例えば、並べ替え特徴の重要度では、モデルがトレーニングデータにフィットされた後、検証セットで与えられた特徴の値を並べ替えた後の予測エラーを測定することによって、特徴の重要度が決定される。与えられた特徴の値をシャッフルすることで、その特徴を使って意味のある予測をするモデルの能力を破壊することになる。
その結果生じる検証誤差の変化を測定したとき、その減少がごくわずかであれば、その特徴が提供する情報は、モデルの予測値を決定する上であまり重要でも有用でもなかったということになる。つまり、その特徴がなくても、モデルはかなり良い仕事ができる。一方、モデルの予測値が低下し、検証誤差が大幅に悪化した場合、その特徴によって提供された情報は、予測を行う際にモデルにとって重要であったに違いない。 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access