Por dentro da mente de um TransformerEvolução das LLMA natureza autorregressiva dos transformadoresArquitetura de transformadores apenas com decodificadorCaptura do contexto do token por meio do cálculo de atençãoExecutando a geração de LLMs: um passo a passoExecute o modelo QwenPrevisão do modelo, linha por linhaAtive o cache KV para melhorar o desempenhoAs fases de pré-preenchimento e decodificaçãoExecute o LLM com uma estrutura de serviço Sirva o LLM (Qwen) com o vLLMComparação de desempenho: vLLM x Hugging Face TransformersNoções básicas sobre a execução de streaming de LLMNoções básicas sobre a implementação em lote de LLMResumo