Capítulo 3. Vocabulário e Tokenização
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
No Capítulo 2, aprofundámos os conjuntos de dados que são utilizados para treinar os modelos linguísticos actuais, incluindo o processo de criação dos mesmos. Esperamos que esta incursão tenha sublinhado a influência que os dados de pré-treino têm no modelo resultante. Neste capítulo, vamos discutir outro ingrediente fundamental de um modelo de linguagem: o seu vocabulário.
Vocabulário
O que fazes primeiro quando começas a aprender uma nova língua? Começa a adquirir o seu vocabulário, expandindo-o à medida que ganha mais proficiência na língua. Vamos definir vocabulário como:
Todas as palavras de uma língua que são compreendidas por uma pessoa específica.
O falante nativo médio de inglês tem um vocabulário de 20.000-35.000 palavras. Da mesma forma, cada modelo de linguagem tem o seu próprio vocabulário, com a maioria dos vocabulários a variar entre 5.000 e 500.000 tokens.
Como exemplo, vamos explorar o vocabulário do modelo GPT-NeoX-20B. Abre o ficheiro tokenizer.json e Ctrl+F para "vocab", um dicionário que contém o vocabulário do modelo. Podes ver que as palavras que compõem o vocabulário do modelo de linguagem não se parecem inteiramente com as palavras da língua inglesa que aparecem num dicionário. Essas unidades semelhantes a palavras são chamadas de "tipos", e a instanciação de um tipo (quando aparece em uma sequência ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access