第8章. ゼロETLまたはニアゼロETL
この作品はAIを使って翻訳されている。ご意見、ご感想をお待ちしている:translation-feedback@oreilly.com
第7章では、 、リアルタイム分析をサポートする代替ソリューションを提供する新しいハイブリッドデータベースを紹介した。これらのシステムはインフラを削減し、分析ワークロードがデータにアクセスしやすくする。ハイブリッドシステムは伝統的に分散システムであったシステムを収束させるため、ハイブリッドシステムはモノリシックシステムに傾くという仮説がある。モノリシックシステムは通常、データワークロードを実行する際のモジュール性とスケーラビリティに欠けることで知られている。
皮肉なことに、モノリシックなデータシステムを分解することは、データベースを分解して裏返し、個々のコンポーネントを特別にスケールさせることに戻る。これは必ずしも否定的な解決策ではない。本書では、伝統的に大規模分散システムにつきものの複雑さとコストを削減するために、これらのシステムをデータベースに戻すことを提案してきた。
ETLとは、システムからシステムへとデータを移動させ、その過程でデータを変換する方法である。これまでは、ストリーミングSQLと呼ばれるETLの形式を使ってきた。この章では、ETLの実装において複雑さとスケーラビリティをどのようにバランスさせるかについて、データワークロードの分散とスケーリングに現在使われている既存のシステムとパターンを取り上げながら説明する。
ETLモデル
図 8-1は、 既存の ETL ソリューションを示したものである。上は HTAP データベースに ETL を導入しないものから、下は Turn-the-Database-inside-out 分散ソリューションまである。ソリューションが三角形の下側にあるほど、分散化され複雑になっている。同様に、上部では、ソリューションはより集中化され、モジュラーモノリスであり、下部に行くほど分散化され、モジュラーになっていく。
図8-1. 増加するETLモデル
三角形の左側がトランザクション・データベースで、右側がカラム型データベースである。三角形の中間にゼロETLが発見される。
ゼロETL
ゼロETL は、OLTPデータベースからOLAPデータベースへのデータ統合を簡素化するために、Amazon Web Services (AWS) によって最初に定義されたパターンである。その提案では、ゼロETLは以下のように定義されている:
[ETLデータパイプラインを構築する必要性を排除または最小化する統合のセット。抽出、変換、ロード(ETL)とは、さまざまなソースからデータを結合、クリーニング、正規化し、アナリティクス、人工知能(AI)、機械学習(ML)のワークロードに対応できるようにするプロセスである。
AWS、"ゼロETLとは何か?"
ゼロETLとは、データ統合とアナリティクスにおけるアプローチや概念のことで、従来のETLプロセスの必要性を最小化、あるいは排除することを目的としている。従来のETLプロセスでは、ソースシステムからデータを抽出し、ターゲットシステムの要件を満たすように変換した後、ターゲットシステムにロードする。アーキテクチャの概要については、 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access