Capítulo 4. Transformando dados com o Apache Spark
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
A plataforma Databricks fornece vários recursos de transformação alimentados pelo Apache Spark. Neste capítulo, navegaremos por várias tarefas de transformação de dados, como consulta de arquivos de dados, gravação em tabelas com várias estratégias e execução de operações ETL avançadas. Além disso, descobriremos o potencial das funções de ordem superior e das funções definidas pelo utilizador (UDFs) no Spark SQL.
Consulta de ficheiros de dados
A consulta de arquivos no Databricks é um aspeto fundamental da exploração e análise de dados. Nesta secção, vamos explorar o processo de consulta do conteúdo dos ficheiros utilizando uma sintaxe semelhante à SQL. O mecanismo principal para isso é a instrução SELECT, que nos permite consultar arquivos diretamente para extrair o conteúdo do arquivo.
Para iniciar uma consulta de ficheiro, usamos a sintaxe SELECT * FROM, seguida do formato do ficheiro e do caminho para o ficheiro, como ilustrado na Figura 4-1. É importante notar que o caminho do ficheiro é especificado entre travessões (`</path/>`), e não entre aspas simples ('</path/>'). Essa distinção é essencial para evitar possíveis erros de sintaxe e garantir a interpretação correta do caminho.
Um caminho de arquivo neste contexto pode referir-se a um único arquivo, ou pode incorporar um caractere curinga para ler simultaneamente ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access