Agent / 分析
Baseten 完成 130 亿美元融资后的技术全景
Baseten 近期完成 130 亿美元 F 轮融资,跻身 AI 基础设施领域的顶级玩家行列。在一期长达近两小时的深度对话中,Baseten 的 Philip Kiely 与 Ali Taha 系统梳理了推理工程这一新兴学科的全貌——从一个 20 万 token 的请求进入推理系统后的完整处理链路,到缓存感知路由、预填充与解码分离、投机解码、KV 缓存迁移、模型并行等核心技术,再到量化误差相互抵消这一反直觉的优化发现。对话还延伸至视频生成、自回归与扩散模型的架构差异、NVIDIA Dynamo 的分布式调度机制,以及训练与推理边界日益模糊的趋势。Ali Taha 此前发布的 Kimi K3 架构深度解析获得逾 200 万次浏览,Philip Kiely 则出版了业内首本系统性推理工程专著,两人的视角兼顾理论深度与工程实践。
三年前,推理工程几乎还不是一个独立的技术类别。如今,它已成为 AI 领域最关键的工程学科之一。推理工程回答的核心问题与模型训练截然不同:如何将训练好的权重转化为一个在规模化场景下快速、可靠且经济可行的产品?这一问题催生了全新的优化方向,也推动了专属基础设施和专业岗位的快速涌现。Baseten 正是在这一浪潮中完成了 130 亿美元的巨额融资,与英伟达等芯片巨头一同成为「推理拐点」时代的核心受益者。
当一个 20 万 token 的请求进入推理系统,背后涉及的工程复杂度远超想象。缓存感知路由允许系统复用此前已计算的 KV 缓存,避免重复计算;预填充与解码阶段的计算特性差异显著,越来越多的部署方案选择将两者交由不同 GPU 处理;投机解码则借助一个小模型预测大模型的输出,在保持质量的前提下大幅提升吞吐量。这些技术的组合使用,可以让同一套模型权重的服务速度提升 2 到 10 倍。
量化是推理优化中最具争议也最具潜力的方向之一。Baseten 在 GLM-5.2 的实验中发现了一个反直觉的现象:对模型进行更大幅度的量化,反而在保持基准测试质量的同时将吞吐量提升了 20%。原因在于,不同层引入的量化误差可以相互抵消,整体误差小于单层误差之和。这一发现基于对群上傅里叶分析的应用,挑战了业界长期以来「量化越多、质量损失越大」的默认假设,也为推理优化打开了新的研究空间。
推理工程的边界正在向模型架构本身延伸。Baseten 团队将 Kimi 的视觉编码器嫁接到 GLM-5.2 的语言模型上,在不修改底层语言模型权重的前提下为其增添了多模态能力。这类「模型改造」操作要求工程师深入理解不同架构组件的接口与兼容性,同时还需应对模型在推理过程中可能出现的退化现象——例如陷入重复输出同一 token 的循环。硬件差异、内核竞争条件等因素也会导致相同权重在不同集群上表现出不一致的行为。
视频生成代表了推理工程当前面临的最高计算挑战之一。长视频生成受制于注意力机制的二次方复杂度瓶颈,开源视频模型在连贯性和质量上仍与 Veo、Kling 等闭源系统存在明显差距。自回归视频生成在实时性上具有潜力,但面临质量漂移的累积问题;扩散模型在质量上更具优势,但计算成本更高。业界普遍预期,未来的视频生成系统将融合两种架构的优势,形成混合方案。
训练与推理的边界正在加速消融。持久化 KV 缓存为模型提供了一种跨会话的「记忆」机制,持续后训练与部署评估形成闭环,使模型能够在服务过程中持续改进。更值得关注的是,GLM-5.2 模型本身参与了优化其自身推理内核的过程——模型帮助优化运行模型的基础设施,这一循环预示着 AI 系统自我优化能力的新阶段。更快的网络互联、更智能的调度算法,将进一步释放解码速度的上限。
要点
- 量化误差在不同层之间可以相互抵消,对 GLM-5.2 进行更激进的量化反而在保持质量的同时提升了 20% 的吞吐量,颠覆了传统认知
- 预填充与解码分离、缓存感知路由、投机解码等技术的组合,可将同一模型的服务速度提升 2 至 10 倍,推理优化空间远未饱和
- 模型架构改造(如将 Kimi 视觉编码器嫁接至 GLM-5.2)正成为推理工程的新前沿,要求工程师同时具备系统工程与模型架构的双重能力
- 长视频生成受制于注意力机制的二次方复杂度,开源模型与闭源系统的差距短期内难以弥合,混合自回归与扩散架构是主流探索方向
- 训练与推理的边界正在模糊,模型参与优化自身推理基础设施的闭环已初步实现,持续学习与部署评估一体化是下一阶段的核心趋势
原始标题:The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。