book

Kubernetes 上的生成式人工智能 (Chinese Edition)

Name: Kubernetes 上的生成式人工智能 (Chinese Edition)
ISBN: 0642572344672

by Roland Huß, Daniele Zonca

February 2026

Intermediate to advanced

406 pages

4h 57m

Chinese

O'Reilly Media, Inc.

Read now

Unlock full access

前言
撰写本书的缘由Kubernetes生成式人工智能本书结构说明本书适合哪些读者您将学到什么本书采用的规范O'Reilly在线学习联系我们鸣谢
导言
大规模运行生成式人工智能的挑战适用于AI工作负载的Kubernetes理解LLM基础LLMs如何处理文本分词与嵌入推理的两个阶段概述推理生产就绪性模型调优AI驱动的应用程序
I. 推理
1. 模型部署
“在我的机器上运行正常”模型服务器vLLMHugging Face文本生成推理其他模型服务器手动将模型部署到Kubernetes模型服务器控制器KServeRay Serve 和 KubeRay经验教训
2. 模型数据
模型数据存储格式仅权重格式自包含格式ONNXSafetensorsGGUF 与 GGML现状与差距模型注册表Hugging Face 模型中心MLflow模型注册表Kubeflow 模型注册表OCI注册表在Kubernetes中访问模型数据使用持久卷实现共享存储用于存储模型数据的OCI映像ModelcarsOCI 映像卷挂载经验教训
II. 生产就绪性
3. Kubernetes 与 GPU
GPU 发现节点功能发现GPU 功能发现Kubernetes GPU设备插件GPU 工作负载调度基于标签的调度基于资源的调度动态资源分配NVIDIA GPU 操作员基于集群策略的运算符配置子GPU分配多GPU推理数据并行性模型并行单节点与多节点推理对比GPU资源优化经验教训
4. 生产环境运行
模型与运行时调优语言模型评估语言模型压缩模型性能基准测试vLLM运行时参数调优自动缩放优化 vLLM 启动时间支持大型LLM的路路由从 API 网关到 AI 网关网关API推理扩展解耦服务经验教训
5. 模型可观测性
可观测性堆栈与配置日志指标追踪模型服务器指标首次令牌耗时每输出令牌耗时或令牌间延迟吞吐量延迟请求队列指标GPU 使用率监控质量指标负责任的人工智能可解释性公平性模型安全：幻觉与防护机制理解与检测幻觉运行时防护栏经验教训
III. 调优

6. 模型定制
LLM创建入门prompt与上下文工程何时使用模型定制模型调优微调参数高效微调低秩适应在Kubernetes上运行调优任务Kubeflow训练器其他框架经验教训
7. 作业调度优化
Kubernetes调度器优化核心 Kubernetes 调度器资源箱装填策略基于调度器解除的动态调度组调度PyTorch 并行调度与团组调度团组调度方案对比拓扑感知调度拓扑感知调度方案对比配额管理与多租户：GPU即服务配额管理与多租户解决方案对比分布式训练的网络优化GPU通信网络技术对比在Kubernetes中使用次要网络接口连接HPC与Kubernetes：Slurm与Slinky训练存储方案训练作业安全性Ray安全指南PyTorch 安全指南训练作业可观测性分布式训练的指标收集跨分布式工作节点的日志记录追踪分布式训练操作经验教训
IV. 人工智能驱动的应用程序
8. 人工智能驱动的应用程序
架构模式Kubernetes 工作负载类型聊天应用程序后端人工智能服务检索增强生成RAG组件文档摄取用户查询处理基于Kubernetes的RAG智能体工作流智能体框架与运行时OpenAI 的响应 API基于Kubernetes的智能体多智能体系统环境智能体经验教训
9. 生产环境中的智能代理应用运行
模型上下文协议MCP安全代理冒充（令牌传递）服务账户委托通过OAuth2令牌交换实现身份委托基于SPIFFE/SPIRE的双向TLS（零信任）代理间协议A2A互补MCPA2A核心概念概览在Kubernetes上运行A2A代理状态管理状态存储模式键值存储与数据库的选择长期运行代理的检查点机制经验教训
后记
我们涵盖的内容结语
索引
关于作者

Content preview from Kubernetes 上的生成式人工智能 (Chinese Edition)

第四章生产环境运行

本作品已使用人工智能进行翻译。欢迎您提供反馈和意见：translation-feedback@oreilly.com

至此，您可能已将首个LLM部署至Kubernetes环境运行。它能响应请求，延迟表现或许尚可。但生产环境的考验在于持续稳定——需在高负载下实现大规模稳定运行。

本章将聚焦这一转型过程。我们将探讨如何在实际场景中实现LLM推理的稳定高效运行。内容涵盖参数调优等常见议题，以及易被忽视的关键环节：运行时内存规划、将粘性请求路由至缓存预热副本、模型压缩决策，以及需要专用网络配置的高级拓扑结构。

将模型服务器视为普通容器固然诱人—— 只需设置资源限制、暴露服务接口便可草草了事。但生成式AI工作负载具有独特特性（超大规模模型、可变请求成本、GPU密集型操作），需要专业化配置。你将学会如何有效配置平台，同时规避那些悄然侵蚀性能、耗尽GPU预算的陷阱。

本章涵盖五大关键领域：

模型与运行时调优: 模型选择、评估、压缩与基准测试
自动扩展: 针对LLM工作负载的特定策略
优化超大规模语言模型启动时间: 降低部署延迟

支持LLM的路由机制: 智能请求分配
解耦服务: 高级分布式架构

最根本的决策在于如何选择并调优模型，使其精准匹配应用场景，同时避免计算周期浪费。

模型与运行时调优

当团队着手开发首个基于生成式AI的实际应用时，最关键的考量因素当属模型选型。多数团队会从OpenAI的ChatGPT这类配置选项有限的托管服务起步。但在许多场景下，本地基础设施是必备条件。此时模型的选择至关重要。该选择需综合考量多种因素，如任务类型、工作负载类型（实时推理与批量推理）及并发请求数量。

模型规模固然重要，但相同规模的两个模型可能采用不同的架构和训练技术，导致相同查询结果从高度准确到完全错误。

鉴于选择的重要性，确定起点颇具挑战。可用模型数量庞大且新模型持续涌现，使筛选过程令人望而生畏。

虽不存在万能解决方案或统治所有场景的单一模型，但筛选时不应涵盖Hugging Face平台上的所有模型。开发预测型AI模型时，常见任务包括基于准确率对比同任务训练模型，因此建立LLMs准确率的比较指标具有重要意义。

传统预测型AI模型针对特定问题进行训练，而LLMs则基于海量数据集训练，可执行多任务。要有效比较LLMs，需先确定应用场景的关键任务，再基于该任务选择准确率指标。

此阶段至关重要，它能引导模型选择基于具体指标而非人工测试。该问题极为复杂，为此已形成语言模型评估的完整研究领域。

语言模型评估

语言模型的评估可针对诸多维度展开，例如衡量模型知识储备的丰富程度、生成无毒语言内容的能力，乃至处理推理任务的优劣表现。该定义并非LLMs专属；在LLM时代之前定义的众多传统语言模型同样适用此原则。

语言评估最重要的应用之一，是通过特定任务验证模型安全性，以衡量模型毒性或鲁棒性。

众多项目提供了单一或多项评估基准；其中最常用的套件是EleutherAI的lm-evaluation-harness，包含上百个开箱即用的任务。此外还有其他库，且常有新评估技术被定义，以在日益复杂的场景中测试模型。

传统评估任务包含两部分：数据集（通常采用简化分析的多选题形式）及其对应的输出结果，以及用于计算指标的评估函数。这种格式便于领域专家审查数据集，并可轻松划分子主题以更精准地分类模型能力。

每个基准测试本质上是一套流程：通过预定义的问答对调用目标模型并分析结果，因此运行耗时（甚至数小时），且需部署模型，执行成本极高。所幸主流模型均可在线查阅排行榜，这些平台汇总了多项基准测试结果，便于模型对比。 ...

Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.

Read now

Unlock full access

More than 5,000 organizations count on O’Reilly

O’Reilly covers everything we've got, with content to help us build a world-class technology community, upgrade the capabilities and competencies of our teams, and improve overall team performance as well as their engagement.

Julian F.

Head of Cybersecurity

I wanted to learn C and C++, but it didn't click for me until I picked up an O'Reilly book. When I went on the O’Reilly platform, I was astonished to find all the books there, plus live events and sandboxes so you could play around with the technology.

Addison B.

Field Engineer

I’ve been on the O’Reilly platform for more than eight years. I use a couple of learning platforms, but I'm on O'Reilly more than anybody else. When you're there, you start learning. I'm never disappointed.

Amir M.

Data Platform Tech Lead

I'm always learning. So when I got on to O'Reilly, I was like a kid in a candy store. There are playlists. There are answers. There's on-demand training. It's worth its weight in gold, in terms of what it allows me to do.

Mark W.

Embedded Software Engineer

Kubernetes 认证管理员 (CKA) 学习指南 (Chinese Edition), 2nd Edition

Publisher Resources

ISBN: 0642572344672

Cloud Computing

Data Engineering

Data Science

AI & ML

Programming Languages

Software Architecture

IT/Ops

Security

Design