Capítulo 4. Arquitecturas e objectivos de aprendizagem
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Nos Capítulos 2 e3, discutimos alguns dos principais ingredientes que fazem parte de um modelo de linguagem: os conjuntos de dados de treino, o vocabulário e o tokenizador. Em seguida, vamos completar o puzzle aprendendo sobre os próprios modelos, as arquitecturas que os sustentam e os seus objectivos de aprendizagem.
Neste capítulo, vamos aprender a composição dos modelos de linguagem e a sua estrutura. Os modelos de linguagem modernos baseiam-se predominantemente na arquitetura Transformer, pelo que dedicaremos a maior parte do nosso tempo a compreendê-la, analisando em pormenor cada componente da arquitetura. Nos últimos anos, foram propostas várias variantes e alternativas à arquitetura Transformer original. Analisaremos as mais promissoras, incluindo os modelos de Mistura de Peritos (MoE). Examinaremos também os objectivos de aprendizagem habitualmente utilizados para treinar os modelos linguísticos, incluindo a previsão do próximo token. Por fim, reuniremos os conceitos dos últimos três capítulos na prática, aprendendo a pré-treinar um modelo de linguagem a partir do zero.
Preliminares
Quase todos os modelos linguísticos contemporâneos se baseiam em redes neuronais, compostas por unidades de processamento chamadas neurónios. Embora as redes neuronais modernas não se assemelhem de todo ao funcionamento ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access