Capítulo 11. Aprendizagem de Representações e Embeddings
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
No capítulo anterior, aprendemos como podemos fazer a interface dos modelos de linguagem com ferramentas externas, incluindo armazenamentos de dados. Os dados externos podem estar presentes sob a forma de ficheiros de texto, tabelas de bases de dados e gráficos de conhecimento. Os dados podem abranger uma grande variedade de tipos de conteúdo, desde bases de conhecimento próprias de um domínio específico até resultados intermédios e outputs gerados por LLMs.
Se os dados forem estruturados, por exemplo, se residirem numa base de dados relacional, o modelo de linguagem pode emitir uma consulta SQL para recuperar os dados de que necessita. Mas e se os dados estiverem presentes de forma não estruturada?
Uma forma de obter dados de conjuntos de dados de texto não estruturados é pesquisar por palavras-chave ou utilizar expressões regulares. Para o exemplo do CFO da Apple no capítulo anterior, podemos obter texto que contenha menções ao CFO a partir de um corpus que contenha divulgações financeiras, na esperança de que contenha a data de adesão ou informações sobre o mandato. Por exemplo, podes usar a regex:
pattern=r"(?i)\b(?:C\.?F\.?O|Chief\s+Financial\s+Officer)\b"
A pesquisa por palavras-chave é limitada na sua eficácia. Há um grande número de formas de exprimir a data de entrada ou o cargo de diretor financeiro ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access