7장. 레이크하우스로 수렴하기
이 작품은 AI를 사용하여 번역되었습니다. 여러분의 피드백과 의견을 환영합니다: translation-feedback@oreilly.com
이쯤 되면 아시다시피, 조직이 데이터 플랫폼을 설계할 때 취할 수 있는 두 가지 주요 접근 방식은 데이터 레이크 또는 DWH 패러다임을 따르는 것입니다. 두 접근 방식 모두 장단점이 있지만, 문제는 두 기술을 공존시켜 융합형 아키텍처를 만들 수 있느냐는 것입니다. 이 장에서는 이 아이디어에 대한 간략한 동기 부여부터 시작하여 이 주제를 살펴본 다음, 융합 아키텍처의 두 가지 광범위한 변형인 레이크하우스 아키텍처를 분석하고이 중 어떤 것을 선택할지 결정하는 데 도움을 드리고자 합니다.
레이크하우스 개념은 정형, 반정형, 비정형 데이터를 대규모로 저장하고 분석할 수 있는 보다 유연하고 확장 가능한 방법을 제공하기 때문에 점점 더 인기를 얻고 있습니다. 레이크하우스는 정형 및 비정형 데이터의 전체 수명주기를 처리할 수 있으며, 이전 두 장에서 배운 데이터 레이크와 DWH 접근 방식의 장점을 결합하여 관리되는 방식으로 사용할 수 있습니다. 이 장의 마지막에서는 레이크하우스 아키텍처로 발전하는 방법에 대해 설명합니다.
고유한 아키텍처의 필요성
데이터 레이크와 DWH는 다양한 사용자의 요구를 충족하기 위해 등장했습니다. 두 가지 유형의 사용자를 모두 보유한 조직은 쉽지 않은 선택에 직면하게 됩니다.
사용자 페르소나
이전 장에서 학습했듯이, 데이터 레이크와 DWH의 몇 가지 주요 차이점은 수집할 수 있는 데이터의 유형과 처리되지 않은(원시) 데이터를 공통 위치에 저장하는 기능과 관련이 있습니다. 따라서 이 두 패러다임의 일반적인 사용자는 서로 다릅니다.
전통적인 DWH 사용자 는 비즈니스에 더 가까운 BI 분석가 로, 데이터에서 인사이트를 도출하는 데 중점을 둡니다. 데이터는 전통적으로 데이터 분석가의 요구 사항에 따라 ETL 도구에 의해 준비됩니다. 이러한 사용자는 일반적으로 데이터를 사용하여 질문에 답합니다. 이들은 SQL에 능숙한 경향이 있습니다.
데이터 레이크 사용자에는 분석가 외에도 데이터 엔지니어 와 데이터 과학자 가 포함됩니다. 이들은 데이터를 탐색하고 마이닝할 수 있는 도구와 기능을 갖추고 있어 원시 데이터에 더 가깝습니다. 이들은 데이터를 비즈니스에서 액세스할 수 있도록 변환할 뿐만 아니라(즉, DWH로 전송할 수 있는 데이터), 데이터를 실험하고 ML 모델 학습 및 AI 처리에 사용합니다. 이러한 사용자는 데이터에서 답을 찾을 뿐만 아니라 비즈니스와 관련된 질문을 찾고 다른 사용자에게 유용하도록 데이터를 준비합니다. 이들은 Python, Java 또는 Scala와 같은 코딩 언어에 능숙한 경향이 있습니다.
안티패턴: 연결이 끊긴 시스템
이러한 다양한 요구 사항()으로 인해 종종 여러 IT 부서 또는 팀에서 DWH와 데이터 레이크를 관리하는 것을 볼 수 있습니다. 그러나 이러한 분리된 접근 방식에는 기회 비용이 발생합니다. 조직은 비즈니스 인사이트에 집중하기보다는 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access