第一章 导言 与人工智能系统概述
本作品已使用人工智能进行翻译。欢迎您提供反馈和意见:translation-feedback@oreilly.com
2024年末,中国一家名为DeepSeek.AI的小型初创公司震惊了 人工智能界——他们成功训练出前沿大型语言模型(LLM),而当时并未使用当时最先进的NVIDIA GPU.受出口限制影响,DeepSeek工程师无法获取顶级NVIDIA Blackwell(B200、B300等)或Hopper(H100、H200等)GPU,因此转而采用当时本地可获取且符合出口规定的替代方案,包括NVIDIA H800 GPU。他们通过定制内核和模型蒸馏等先进优化技术,从性能较弱的GPU中榨取最大效能。
尽管存在这些限制,DeepSeek.AI仍成功训练出DeepSeek-R1模型,其推理能力接近当时在顶级NVIDIA芯片上训练的前沿模型。该案例彰显了人工智能系统性能工程领域的实践者与研究者,能够充分挖掘现有硬件潜力——无论面临何种限制。
例如,DeepSeek工程师将 通信带宽视为稀缺资源,通过优化传输中的每个字节,实现了许多人认为在该基础设施上不可能实现的目标。他们利用创新的软件和算法优化,将数千台带宽受限的GPU(通过有限带宽互连设备连接)进行横向扩展,从而克服了这些限制。
对比DeepSeek的做法,欧美大型前沿AI实验室仍在走"蛮力"路线。这些实验室持续追求更大的计算集群和更庞大的模型规模。模型参数量已从数百万激增至数十亿,如今更突破万亿量级。虽然每次十倍级规模扩张都带来质的飞跃,但其代价是惊人的成本与资源消耗。
例如:据报道OpenAI的GPT-4(2023年)训练成本约1亿美元,而谷歌Gemini Ultra(2023年末)的训练成本更是高达约1.91亿美元。这表明随着模型规模与成本持续攀升,资源效率已成为未来发展的关键需求。
DeepSeek宣称其 DeepSeek-R1模型仅耗费不到600万美元的计算成本——比GPT-4和Gemini Ultra等模型低一个数量级。与此同时,DeepSeek-R1在性能上可与耗资高出数个数量级的竞争对手模型比肩。
尽管 对600万美元成本的真实性存疑——包括具体涵盖范围(如仅单次训练)与排除项(如实验环节及模型开发流程)——该声明仍短暂冲击美国金融市场,英伟达股价单日应声下跌约17%。市场担忧源于DeepSeek的效率创新可能减少未来对英伟达硬件的需求。尽管这种市场反应略显过度——英伟达股价在后续交易日已回升——但事件凸显了人工智能效率突破对全球金融市场的重大影响。
除模型训练外, 的DeepSeek通过对驱动现代前沿LLMs的Transformer架构进行创新性硬件感知算法改进,实现了显著的推理效率提升。DeepSeek清晰证明:精妙的AI系统性能工程优化能颠覆超大规模AI模型训练与推理的经济模式。本书后续章节将全面阐述这些优化方案。
核心洞见在于:在如此规模下,系统中榨取的每一分性能提升都可能转化为数百万甚至数十亿美元的成本节约。每个消除的瓶颈都将对训练吞吐量和推理延迟产生倍增效应,进而降低成本并提升终端用户满意度。简言之,AI系统性能工程不仅关乎速度——更在于让曾经不可能实现的技术既可行又可负担。
第一章将深入剖析AI系统性能工程师这一角色——在大规模人工智能时代,该职业已然成为关键枢纽。本章作为综合指南,将全面阐释该职业的多维职责及其对现代AI系统产生的关键影响。
我们首先追溯AI工作负载的演变历程,重点阐释传统计算范式向当代AI应用需求的转变。这一背景为理解AI领域专业性能工程的必要性奠定基础。 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access