Capítulo 3. Fundamentos da engenharia de dados
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
O aumento do ML nos últimos anos está intimamente ligado ao aumento dos grandes volumes de dados. Os grandes sistemas de dados, mesmo sem o AM, são complexos. Se não tiveres passado anos e anos a trabalhar com eles, é fácil perderes-te nos acrónimos. Há muitos desafios e possíveis soluções que estes sistemas geram. As normas da indústria, se é que existem, evoluem rapidamente à medida que surgem novas ferramentas e as necessidades da indústria se expandem, criando um ambiente dinâmico e em constante mudança. Se olhares para a pilha de dados de diferentes empresas de tecnologia, pode parecer que cada uma está a fazer o seu próprio trabalho.
Neste capítulo, abordaremos as noções básicas de engenharia de dados que, esperamos, te darão um pedaço de terra firme para te apoiares enquanto exploras a paisagem para as tuas próprias necessidades. Começaremos com as diferentes fontes de dados com que podes trabalhar num projeto típico de ML. Continuaremos a discutir os formatos em que os dados podem ser armazenados. O armazenamento de dados só é interessante se pretenderes recuperar esses dados mais tarde. Para recuperar os dados armazenados, é importante saber não apenas como eles estão formatados, mas também como estão estruturados. Os modelos de dados definem a forma como os dados armazenados num determinado formato de dados ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access