Capítulo 5. Processamento de dados incrementais
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Nos capítulos anteriores, explorámos os fundamentos do processamento de dados em grupos ou lotes de uma só vez. No entanto, quando os dados são gerados continuamente, as abordagens tradicionais de processamento em lote tendem a se tornar insuficientes. Neste capítulo, exploraremos os conceitos e as técnicas de processamento de dados de fluxo contínuo, incluindo o fluxo contínuo estruturado do Spark e a ingestão incremental de dados de arquivos. Além disso, discutiremos o conceito de arquitetura medalhão e como construí-la sob o modelo de processamento de fluxo.
Streaming de dados com o Apache Spark
O Apache Spark fornece um suporte robusto para o processamento de dados de fluxo contínuo, permitindo-te realizar análises em tempo real de forma eficiente. No centro desse processo está o conceito de um fluxo de dados, que é o foco do processamento. Para trabalhar efetivamente com dados de streaming no Spark, vamos primeiro entender o que é um fluxo de dados e suas caraterísticas.
O que é um fluxo de dados?
Um fluxo de dados representa um fluxo ilimitado de dados, muitas vezes proveniente de várias fontes, como sensores, ficheiros de registo ou plataformas de redes sociais. À medida que novos dados são gerados, eles são anexados ao fluxo, tornando-o um conjunto de dados dinâmico e em constante mudança. Exemplos de ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access