Sistemas de produção de aprendizagem automática
by Robert Crowe, Hannes Hapke, Emily Caveness, Di Zhu
Capítulo 21. Pipelines de ML para processamento de linguagem natural
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
No capítulo anterior, discutimos como criar um pipeline para um problema de produção de visão computacional, no nosso caso, a classificação de imagens em categorias. Neste capítulo, queremos demonstrar-te um tipo diferente de problema de produção. Mas em vez de passarmos por todos os detalhes genéricos, vamos concentrar-nos nos aspectos específicos do projeto.
Neste capítulo, demonstramos o desenvolvimento de um modelo de ML que classifica dados de texto não estruturados. Em particular, vamos treinar um modelo de transformação, neste caso um modelo BERT, para classificar o texto em categorias. Como parte do pipeline, vamos dedicar um esforço significativo aos passos de pré-processamento do pipeline. O fluxo de trabalho que apresentamos funciona com qualquer problema de linguagem natural, incluindo os mais recentes modelos de linguagem de grande porte (LLMs).
O pipeline vai ingerir os dados brutos de um ficheiro CSV exportado, e vamos pré-processar os dados com a TF Transform. Depois que o modelo for treinado, combinaremos o pré-processamento e o gráfico do modelo para evitar qualquer distorção que sirva ao treinamento.
Nota
Neste capítulo, vamos nos concentrar em novos aspectos do pipeline (por exemplo, a ingestão de dados ou o pré-processamento). Para obter mais informações sobre como executar ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access