Chapitre 5. Traitement des données incrémentielles
Cet ouvrage a été traduit à l'aide de l'IA. Tes réactions et tes commentaires sont les bienvenus : translation-feedback@oreilly.com
Dans les chapitres précédents, nous avons exploré les principes fondamentaux du traitement des données par groupes ou par lots en une seule fois. Cependant, lorsque les données sont générées en continu, les approches traditionnelles de traitement par lots ont tendance à devenir insuffisantes. Dans ce chapitre, nous allons explorer les concepts et les techniques de traitement des données en continu, notamment le streaming structuré Spark et l'ingestion incrémentale de données à partir de fichiers. De plus, nous aborderons le concept d'architecture en médaillon et la façon de la construire dans le cadre du modèle de traitement en continu.
Streaming de données avec Apache Spark
Apache Spark offre une prise en charge robuste du traitement des données en continu, ce qui te permet d'effectuer efficacement des analyses en temps réel. Au cœur de ce processus se trouve le concept de flux de données, qui est au centre du traitement. Pour travailler efficacement avec des données en continu dans Spark, commençons par comprendre ce qu'est un flux de données et ses caractéristiques.
Qu'est-ce qu'un flux de données ?
Un flux de données représente un flux illimité de données, provenant souvent de diverses sources telles que des capteurs, des fichiers journaux ou des plateformes de médias sociaux. À mesure que de ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access