October 2025
Intermediate to advanced
878 pages
12h 53m
Chinese
本作品已使用人工智能进行翻译。欢迎您提供反馈和意见:translation-feedback@oreilly.com
在第15章和第16 章中,我们构建了各种各样的变形器,从分类器、翻译器和聊天机器人,到视觉和多模态变形器。虽然变形程序用途广泛、功能强大,但它们远非完美无缺。尤其是在处理长输入序列时,它们的速度可能会非常慢。
幸运的是,我们已经开发出了许多技术来加快任何规模的变换器:
为了加快生成式变换器的解码速度,我们将使用键/值缓存和推测解码,然后我们将快速了解几种并行化文本生成的方法。
多头注意力(MHA)是变换器中计算成本最高的部分之一,为了加速多头注意力,我们将研究稀疏注意力、近似注意力、共享投影和 FlashAttention。
为了加速处理多达数万亿个参数的大型变换器,我们将讨论专家混合(MoE)。
为了高效地训练大型变换器,我们将讨论使用适配器进行参数高效微调(PEFT),这些适配器包括低链适配(LoRA)、激活检查点、序列打包、梯度累积和并行性。
加快变换器速度的另一种方法是缩小变换器。这可以通过降低精度和量化来实现,附录 B 将对此进行讨论。
本章要介绍的技术相当多,而且相当高级,所以如果你是变压器的新手,可以暂时跳过本章,以后有需要时再来学习。这也是本章仅在https://homl.info 上提供的原因,以便为其他章节留出空间。
Read now
Unlock full access