Skip to Content
実践者向けの説明可能なAI
book

実践者向けの説明可能なAI

by Michael Munn, David Pitman
May 2025
Intermediate to advanced
278 pages
4h 26m
Japanese
O'Reilly Media, Inc.
Content preview from 実践者向けの説明可能なAI

第3章. 表形式データの説明可能性

この作品はAIを使って翻訳されている。ご意見、ご感想をお待ちしている:translation-feedback@oreilly.com

ディープラーニングの成功の多くは、画像、テキスト、音声、動画などの非構造化データに焦点を当てている。しかし、実運用されている機械学習モデルの大部分は、表形式のデータを念頭に置いて構築されている。リレーショナルデータベースやスプレッドシートに含まれる、数値やカテゴリカルな特徴セットで構成されたデータを思い浮かべてほしい。これらは構造化データの例であり、実際のAIユースケースの大部分を占めている。この章では、シャプレー値、並べ替え特徴の重要度、ツリー・インタプリタ、部分依存プロットの様々なバージョンなど、表形式データを扱うときに最もよく使われる説明可能性テクニックを検証する。

順列 特徴の重要性

ここでは、順列特徴の重要性について知っておく必要があることを説明する:

  • 一旦モデルがトレーニングデータ( )に適合されると、1つの特徴に対する並べ替え重要度は、その特徴値がランダムにシャッフルされたときのモデルスコアの減少を測定する。

  • ある特徴()の値をシャッフルすることで、その特徴を使って意味のある予測をするモデルの能力を破壊することになる。もしモデルの予測値が低下し、モデルスコアが大幅に悪化するのであれば、その特徴によって提供される情報は、予測を行う際にモデルにとって重要であったに違いない。一方、モデルスコアの変化がごくわずかであれば、その特徴はそれほど重要ではないことになる。

長所 短所
  • 実装は簡単だ。Scikit-learnは、並べ替え特徴の重要度を計算するための素晴らしく使いやすいライブラリを提供している。

  • 結果は直感的である。並べ替えによる特徴の重要性のメソッドは説明しやすく、理解しやすい。

  • 並べ替えに基づくメソッドは、表形式データの混合モード(例えば、数値特徴とカテゴリー特徴)でも同様に機能する。

  • 特徴の相関性が高い場合、結果は誤解を招く可能性がある。このメソッドには、特徴が独立しているという前提がある。

  • 並べ替えインポートの結果は、その特徴量自体の本質的な予測値を反映するのではなく、その特徴量が特定のモデルにとってどの程度重要であるかを反映する。

  • 順列インポートの計算は、特徴シャッフルに大きく依存し、シャッフルが異なると結果が異なる場合がある。より正確な結果を得るためには、複数回の実行が必要かもしれない。

Permutation featureimportanceは、表データセットによく使われる摂動ベースの特徴属性テクニックである(特徴属性と摂動テクニックについては第2章参照)。一般的なパターンは、モデル特徴に摂動が加えられたり、何らかの変更が加えられたりした後、これらの新しい例で予測が行われる。この新しい摂動された例のコレクションからのモデル予測を使って、モデルの予測がどのように変化するかを見ることによって、各特徴が予測に与える影響を決定することができる。

例えば、並べ替え特徴の重要度では、モデルがトレーニングデータにフィットされた後、検証セットで与えられた特徴の値を並べ替えた後の予測エラーを測定することによって、特徴の重要度が決定される。与えられた特徴の値をシャッフルすることで、その特徴を使って意味のある予測をするモデルの能力を破壊することになる。

その結果生じる検証誤差の変化を測定したとき、その減少がごくわずかであれば、その特徴が提供する情報は、モデルの予測値を決定する上であまり重要でも有用でもなかったということになる。つまり、その特徴がなくても、モデルはかなり良い仕事ができる。一方、モデルの予測値が低下し、検証誤差が大幅に悪化した場合、その特徴によって提供された情報は、予測を行う際にモデルにとって重要であったに違いない。 ...

Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.

Read now

Unlock full access

More than 5,000 organizations count on O’Reilly

AirBnbBlueOriginElectronic ArtsHomeDepotNasdaqRakutenTata Consultancy Services

QuotationMarkO’Reilly covers everything we've got, with content to help us build a world-class technology community, upgrade the capabilities and competencies of our teams, and improve overall team performance as well as their engagement.
Julian F.
Head of Cybersecurity
QuotationMarkI wanted to learn C and C++, but it didn't click for me until I picked up an O'Reilly book. When I went on the O’Reilly platform, I was astonished to find all the books there, plus live events and sandboxes so you could play around with the technology.
Addison B.
Field Engineer
QuotationMarkI’ve been on the O’Reilly platform for more than eight years. I use a couple of learning platforms, but I'm on O'Reilly more than anybody else. When you're there, you start learning. I'm never disappointed.
Amir M.
Data Platform Tech Lead
QuotationMarkI'm always learning. So when I got on to O'Reilly, I was like a kid in a candy store. There are playlists. There are answers. There's on-demand training. It's worth its weight in gold, in terms of what it allows me to do.
Mark W.
Embedded Software Engineer

You might also like

データエンジニアリングの設計パターン

データエンジニアリングの設計パターン

Bartosz Konieczny
データガバナンス定義ガイド

データガバナンス定義ガイド

Evren Eryurek, Uri Gilad, Valliappa Lakshmanan, Anita Kibunguchy-Grant, Jessi Ashdown

Publisher Resources

ISBN: 9798341651623