Capítulo 4. Dados de treino
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
No Capítulo 3, abordámos a forma de lidar com os dados na perspetiva dos sistemas. Neste capítulo, veremos como lidar com os dados da perspetiva da ciência de dados. Apesar da importância dos dados de treino no desenvolvimento e melhoria dos modelos de ML, os currículos de ML são fortemente orientados para a modelação, que é considerada por muitos profissionais a parte "divertida" do processo. Construir um modelo topo de gama é interessante. Passar dias a lidar com uma enorme quantidade de dados mal formatados que nem sequer cabem na memória da tua máquina é frustrante.
Os dados são confusos, complexos, imprevisíveis e potencialmente traiçoeiros. Se não forem tratados corretamente, podem facilmente afundar toda a tua operação de ML. Mas é precisamente por esta razão que os cientistas de dados e os engenheiros de ML devem aprender a lidar bem com os dados, poupando-nos tempo e dores de cabeça no futuro.
Neste capítulo, abordaremos técnicas para obter ou criar bons dados de treinamento. Os dados de treinamento, neste capítulo, englobam todos os dados usados na fase de desenvolvimento de modelos de ML, incluindo as diferentes divisões usadas para treinamento, validação e teste (as divisões de treinamento, validação e teste). Este capítulo começa com diferentes técnicas de amostragem para selecionar dados para treino. Em seguida, abordaremos ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access