book

LLM 服务和优化实践 (Chinese Edition)

Name: LLM 服务和优化实践 (Chinese Edition)
ISBN: 0642572383695

by Chi Wang, Peiheng Hu

May 2026

Intermediate

374 pages

5h 3m

Chinese

O'Reilly Media, Inc.

Read now

Unlock full access

前言
为何要进行LLM的部署与优化？本书的目标本书适合哪些读者本书不涵盖的内容本书的结构如何使用本书您需要准备什么本书采用的约定如何使用代码示例O’Reilly 在线学习联系我们致谢
1. 模型服务与优化简介
模型的构成模型架构模型数据模型执行代码模型生命周期：从训练到服务什么是模型服务？为何要学习模型服务？为何要优化模型服务（特别是针对LLMs）？示例：利用模型服务框架（vLLM）提升LLM的吞吐量模型服务范式设备端（边缘）服务单模型服务多模型服务模型服务平台总结
2. 大型语言模型服务
透视Transformer的内部机制LLM的演进Transformer 的自回归特性仅解码器Transformer架构通过计算注意力机制捕获令牌上下文执行LLM生成：分步指南运行 Qwen 模型逐行模型预测启用 KV 缓存以提升性能预填充与解码阶段使用服务框架运行 LLM 使用 vLLM 提供 LLM（Qwen）服务性能对比：vLLM 与 Hugging Face TransformersLLM 流式服务基础LLM 批处理服务基础总结
3. 模型服务系统设计：深度解析
从零开始构建在线LLM服务设计目标服务架构实现单次生成请求处理批处理流式处理与批处理使用 vLLM 进行批量服务单模型LLM服务的通用设计单模型服务的要求总体设计从零开始构建多模型服务设计目标服务架构核心实现使用 NVIDIA Triton 作为模型服务器多模型服务设计中的权衡挑战一种成本优化的多模型设计一种延迟优化的多模型设计总结
4. 模型服务最佳实践
代理化环境中的模型服务定义代理一个示例知识代理代理的设计代理的内部工作流代理的自主性检索增强生成（RAG）缓存增强生成（CAG）代理如何使用模型服务企业系统中的LLM服务：概述公共API层资源管理层模型选择与编排层分布式服务层核心推理层模型优化层模型层基于开源技术栈的构建实现公共 API实现模型选择实现模型服务端点基于Cloud服务商进行构建选项 1：完全托管的基础模型服务选项 2：一键式基础模型部署选项 3：自带模型选项 4：自带代码选项 5：自带服务镜像选项 6：构建您自己的服务基础设施方案对比自建还是采购？策略解析为何了解构建方法大有裨益——即使您不打算亲自构建我们的选择策略LLM服务中的性能评估延迟指标吞吐量指标性能测量的最佳实践摘要
5. LLMs服务中的挑战
为何优化 LLM 服务至关重要用户体验成本效益可扩展性、峰值负载处理及可行性加速器芯片在LLM服务中的作用解读 GPU 规格热门 GPU 规格对比LLM模型加载中的瓶颈模型加载过程模型大小估算估算KV缓存大小LLM模型执行中的瓶颈GPU 计算和内存带宽的限制矩阵乘法中的算术强度将算术密集度分析应用于LLM的预填充和解码阶段其他 AI 加速器与趋势摘要
6. 必备的LLM优化技术
请求批处理与调度层面的优化为什么实时服务中需要批处理？在线推理中的动态批处理LLM在线推理的连续批处理基于分块预填充的连续批处理注意力机制的扩展与内核优化可扩展的注意力机制核融合与自定义注意力核模型压缩量化知识蒸馏剪枝前缀缓存基数注意力应用场景最佳实践扩展前缀缓存摘要
7. 高级LLM优化技术
预测性解码详细步骤调优与使用实践：推测性解码多GPU和多节点推理数据并行张量并行与流水线并行专家级并行预填充-解码解聚整体架构KV缓存传输何时使用高级键值对缓存长上下文服务成本与延迟计算自托管LLMsLMCache 实践摘要
8. LLM服务框架
为何我们需要专门的LLM服务框架vLLMvLLM 的架构模型初始化工作流（带多进程工作进程）生成请求执行工作流调度器深度解析vLLM的分层优化策略TensorRT-LLMSGLangLlama.cpp选择合适的框架总结
9. LLM 优化实践
LLM 服务优化方案利用 vLLM 优化 Qwen3-14B 服务步骤 1：检测 GPU 硬件步骤 2：生成基准测试流量步骤 3：定义评估指标步骤 4：配置模型服务服务器步骤 5：使用 vLLM 对 Qwen3 模型进行基准测试步骤 6：使用 vLLM 对量化版 Qwen3 模型进行基准测试步骤 7：应用其他优化技术步骤 8：使用分布式服务对 Qwen3 模型进行基准测试常见的优化权衡摘要

10. LLM服务领域的最新进展
语义缓存性能剖析策略多模态服务多模态输入处理架构与系统影响边缘AI：驱动因素与使能技术专用低功耗硬件模型压缩与优化异构计算考虑热效应的调度边缘-Cloud混合计算多LoRA服务强化学习中的模型服务强化学习中的LLM服务强化学习服务中的确定性总结
目录
关于作者

Content preview from LLM 服务和优化实践 (Chinese Edition)

第 1 章. 模型部署与优化导论

本作品已使用人工智能进行翻译。欢迎您提供反馈和意见：translation-feedback@oreilly.com

在过去的十年里，人工智能系统已从离线研究原型演变为嵌入日常产品中的实时、面向用户的功能。现代 AI 工作流涵盖了从数据收集、模型训练到部署、监控及持续迭代的完整生命周期，而随着 Deep Learning 和 LLMs 的兴起，这一生命周期的迭代速度已大幅加快。尽管训练日益强大的模型吸引了大量关注，但在生产环境中可靠且高效地部署这些模型已变得同样关键。

从本质上讲，模型服务是一个 旨在解决如何让终端用户、应用程序和系统访问 AI 模型的流程，它通过 API、Web 服务或集成工作流，对新的、未见过的数据生成预测（称为推理）。

用一个简单的比喻来说，对于各类企业——无论其目标是向客户提供 AI 能力，还是提升运营效率——模型服务都是一种供应链。除非能以合适的延迟、可靠性和成本特性交付给用户，否则经过训练的模型几乎没有商业价值。例如，亚马逊和 Netflix 利用模型服务在用户浏览时即时更新推荐内容；银行利用模型服务在网购结账时拦截欺诈交易；航空公司的聊天机器人则利用它提供即时航班更新和改签选项。如果这些公司的模型服务系统出现故障，业务将陷入停滞。

正如每家制造商都致力于构建高效且经济实惠的供应链，AI 企业也力求在生产环境中高效、有效地利用其模型和硬件。因此，选择正确的模型服务方案并对其进行优化至关重要：这直接关系到企业的生命线和运营成本。无论您担任何种角色，只要身处 AI 行业，了解模型服务相关知识都将使您受益匪浅。

作为在模型服务基础设施领域深耕十余年的技术领军者，我们曾与该领域的各类参与者合作：包括研究人员、开发者、高管、市场人员、客户以及学生。我们发现，人们初次尝试理解模型服务时，往往会感到畏难或不知所措。这主要有三个原因。首先，你应该已经具备深厚的模型训练知识。其次，目前尚无一条清晰的学习路径，能够从入门教程直接过渡到管理世界级的模型服务系统。第三，市面上存在如此众多的框架、库、供应商及其他工程选项，使得选择何者采用变得困难。本书旨在通过提供一份结构化且实用的模型服务与优化指南来应对上述挑战——该指南既弥合了理论与实践之间的鸿沟，又能赋能读者做出明智的决策。

在本章中，我们将为您理解本书后续内容奠定基础。首先，我们将阐明模型服务的核心概念；随后，探讨为何稳健且经过优化的模型服务对实际应用至关重要；最后，我们将探讨模型服务的一般范式。读完本章，您将对模型服务与优化有一个全面的概述，为后续章节的实践内容做好准备。

模型的构成

从学术角度而言，机器学习（ML）模型是一种数学表示或算法，它能够从数据中学习模式，从而进行预测、决策或推断，而无需针对特定任务进行显式编程。

在工程和运营领域，我们更关注如何使用模型，而非如何训练模型。因此，大多数情况下，我们仅将模型视为黑箱——即由机器学习训练过程生成的（可执行）文件集合。

我们认为模型由三类文件组成：数据、架构和执行代码（见图 1-1）：

模型数据: 模型的数据包括其权重、偏置和配置。权重和偏置是模型在训练过程中学习到的内容，而模型配置则包含运行模型所需的元数据，例如嵌入向量和标签类别（针对分类模型）、max_batch_size（针对批量推理）以及输入和输出张量。
模型架构: 架构指机器学习模型的结构与设计。它定义了模型的组织方式，包括层的类型和数量、层与层之间的连接，以及模型执行的操作。架构决定了模型如何处理输入数据以产生输出预测或决策。 ...

Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.

Read now

Unlock full access

More than 5,000 organizations count on O’Reilly

O’Reilly covers everything we've got, with content to help us build a world-class technology community, upgrade the capabilities and competencies of our teams, and improve overall team performance as well as their engagement.

Julian F.

Head of Cybersecurity

I wanted to learn C and C++, but it didn't click for me until I picked up an O'Reilly book. When I went on the O’Reilly platform, I was astonished to find all the books there, plus live events and sandboxes so you could play around with the technology.

Addison B.

Field Engineer

I’ve been on the O’Reilly platform for more than eight years. I use a couple of learning platforms, but I'm on O'Reilly more than anybody else. When you're there, you start learning. I'm never disappointed.

Amir M.

Data Platform Tech Lead

I'm always learning. So when I got on to O'Reilly, I was like a kid in a candy store. There are playlists. There are answers. There's on-demand training. It's worth its weight in gold, in terms of what it allows me to do.

Mark W.

Embedded Software Engineer

Publisher Resources

ISBN: 0642572383695

Cloud Computing

Data Engineering

Data Science

AI & ML

Programming Languages

Software Architecture

IT/Ops

Security

Design

Business

Soft Skills

LLM 服务和优化实践 (Chinese Edition)

by Chi Wang, Peiheng Hu

第 1 章. 模型部署与优化导论

模型的构成

Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.