October 2024
Intermediate to advanced
388 pages
5h 45m
Japanese
本書では、モデルがどのように構築され、どのように構造化されるかといったアルゴリズムの詳細についてはほとんど触れていません。昨年最もエキサイティングだったアルゴリズムの開発は、来年にはありふれた実行ファイルになるのです。その代わり、私たちが圧倒的に関心を持つのは、モデルを構築するために使われるデータと、データを受け取ってモデルに変換するための処理パイプラインの2つです。
最終的に、MLシステムはデータ処理パイプラインであり、その目的はデータから使用可能で再現性のある洞察を抽出することです。しかし、MLパイプラインと従来のログ処理および解析パイプラインには、いくつかの重要な違いがあります。MLパイプラインには、非常に異なる特定の制約があり、様々な方法で失敗します。その成功は測定しにくく、多くの失敗を検出することも困難です。基本的には、データを消費し、そのデータを処理したものを出力します(ただし、両者の形態は大きく異なります)。そのため、MLシステムはデータシステムの構造、性能、精度、信頼性に完全に依存します。このことは、MLシステムを信頼性の観点から考える上で最も有用な方法です。
本章では、まずデータそのものについて深く掘り下げます。
ここでは、データの運用要件を説明し、モデルと同様に、運用中のデータにもライフサイクルがあることを紹介します。
また、データアクセスの制約、プライバシー、監査可能性に関する懸念についても説明し†1、データの来歴(データがどこから来たのか)と ...
Read now
Unlock full access