Agent / 分析
Modal CTO 谈构建新型智能体云
在 Latent Space 的「智能体云」系列收官节目中,主持人 Swyx 与 Vibhu 对话 Modal 联合创始人兼 CTO Akshat Bubna。Modal 刚刚完成 3.55 亿美元 C 轮融资,从一家无服务器基础设施公司跃升为面向 AI 工作负载的智能体云平台。Bubna 回顾了 Modal 不依赖 Kubernetes 构建新运行时的初衷,解释为什么 Kubernetes 并非为突发型、计算密集型负载而设计,以及为什么 ChatGPT 出现之前 Modal 就已引入 GPU。文章重点阐述了从开发者体验到智能体体验的范式转变:智能体需要可编程基础设施来写代码、运行、调试并快速迭代。节目还深入讨论了弹性推理、沙箱隔离、GPU 快照、推测解码、跨 17 家云厂商的容量池,以及生产级智能体所需的安全护栏等关键技术议题。
在 Latent Space 的「智能体云」系列收官集中,主持人 Swyx 与 Vibhu 对话 Modal 联合创始人兼 CTO Akshat Bubna。Modal 刚刚完成 3.55 亿美元 C 轮融资,成为从无服务器基础设施公司演变为 AI 原生云平台的代表案例。Bubna 回顾了 Modal 当初为何选择绕开 Kubernetes 另起炉灶,并解释公司早在 ChatGPT 问世之前就已经率先引入 GPU 支持,为后续承接 AI 工作负载抢占先机。
Bubna 指出,传统云基础设施是为人类开发者设计的,他们可以阅读文档、理解 YAML、解读仪表盘,并在系统出错时补足缺失的上下文。但智能体没有这种能力,它们需要的是「智能体体验」:可编程的接口、能够写代码并运行、检视输出、修改环境、调试失败、快速重试的完整闭环。沙箱机制正是这一转变的缩影,让智能体能够按需启动隔离环境,把基础设施变成可调用的原语。
节目深入拆解了 Modal 的 AI 基础设施栈:无服务器函数、装饰器风格的基础设施定义、面向自定义模型的弹性推理、GPU 快照、DeFlash 优化、推测解码、Auto Endpoints 部署、沙箱、持久化存储、网络化容器、私有 IPv6、RDMA 高速互联、多节点训练,以及横跨 17 家云厂商的容量池。每一个组件都瞄准智能体工作负载的实际需求:冷启动要够快、突发算力要弹得出、长任务要稳得住。
在被问及强化学习场景时,Bubna 透露一次完整的 RL rollout 可能需要多达 10 万个沙箱并发运行,这对传统云架构几乎是不可想象的任务规模。Modal 的策略是用专门的生产级沙箱加上硬性护栏来托底,同时强调可观测性比读懂代码更重要——当智能体自己写代码时,运维人员必须依赖日志、追踪和指标来判断系统是否健康。他也将这种思路概括为「AI 让基础设施重新变得令人兴奋」。
在生态定位层面,Bubna 明确 Modal 并不打算替代 vLLM、SGLang 或裸 GPU 租赁,而是在它们之上提供更易用的推理端点和智能体生命周期管理。围绕 Auto-research、模型驱动的参数扫描、以及智能体自主发起 GPU 实验等场景,Modal 还展示了模型引导的 sweep 能力和 batch 分层算力策略。最后,节目讨论了托管式智能体、CI 集成、TypeScript 与 Python SDK,以及 Modal 自家的评测平台 Modal Bench,把「开发者体验」的边界正式延伸到「智能体体验」。
要点
- Modal 完成 3.55 亿美元 C 轮融资,定位从无服务器公司升级为承载 AI 工作负载的智能体云,弹性推理、沙箱与 GPU 突发算力成为核心业务。
- Kubernetes 并非为突发型、GPU 密集型负载设计,Modal 选择构建自有的新运行时,并在 ChatGPT 出现前就率先引入 GPU,提前卡位 AI 基础设施赛道。
- 「智能体体验」取代「开发者体验」成为新范式:智能体需要可编程基础设施来完成写代码、运行、调试、快速迭代的闭环,沙箱是这一转变的标志性原语。
- 强化学习 rollout 可能需要 10 万级并发沙箱,传统云架构难以承接,Modal 以专门沙箱加硬性护栏应对,并强调可观测性比读懂代码更重要。
- Modal 跨 17 家云厂商聚合容量的「超级云」策略结合私有 IPv6 与 RDMA 网络,为多节点训练、后训练以及智能体发起的 GPU 实验提供底层支撑。
原始标题:Why AI Infrastructure must evolve for Agent Experience — Akshat Bubna, Modal CTO
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。