产业 / 媒体
英特尔实验数千次工作负载后,总结出企业部署智能体AI的五条实践法则
对企业而言,智能体AI(Agentic AI)的价值远不止于一个更好用的聊天机器人。它代表着能够跨人员、业务流程、数据与系统端到端执行任务的软件智能体。为深入理解这类工作负载的特性,英特尔开展了数千次智能体AI实验,并在开源基准工具Terminal-Bench的基础上进行了扩展,加入了性能剖析、遥测与回放能力。研究发现,现有大多数智能体评估框架仅关注大语言模型本身的推理性能,而忽视了任务编排、数据访问、工具调用、延迟管理与治理等系统层面的关键因素。英特尔由此归纳出五条实践原则:以每vCPU智能体密度而非智能体数量规划容量;以P95任务延迟而非平均CPU利用率作为主要监控指标;优先采用横向扩展策略;并将智能体AI的落地重点放在已有明确规则与可量化服务水平的业务流程上。
智能体AI的企业价值在于其能够自主规划多步骤任务、调用外部工具、读取执行结果并在失败时自动重试。这种目标驱动的自动化工作流模式,使其本质上成为一个系统工程问题,而非单纯的模型推理问题。任务编排、数据访问、工具执行、延迟控制、治理合规与可扩展基础设施,共同决定了智能体在企业环境中能否真正创造价值。
为建立更贴近企业实际的评估体系,英特尔扩展了开源基准工具Terminal-Bench,引入了确定性的LLM响应录制与回放机制,将智能体自身的性能表现与模型输出的随机性剥离开来。测试任务涵盖编译、数据库操作、线性代数、视频转码、机器学习训练等十余种类型,确保结论对真实企业场景具有广泛适用性。研究团队同时提出了六项核心指标:任务成功率、单任务成本、单任务耗时、任务吞吐量、智能体密度(每vCPU智能体数)以及端到端延迟。
容量规划应以智能体密度为核心单位。研究发现,在8个vCPU上运行10个智能体与在16个vCPU上运行20个智能体,若密度相同则系统行为高度一致。这为架构师提供了跨实例规格和处理器代际进行容量对比的可移植方法。面向用户的交互式助手应保持较低密度以保证响应速度,而IT工单处理等批量任务则可在更高密度下运行,从而在服务水平目标与总拥有成本之间取得平衡。
平均CPU利用率并不适合作为智能体工作负载的主要监控指标。智能体通常在等待模型响应与短暂的计算密集型操作之间交替切换,这种突发性模式会导致平均利用率看似正常,实则已出现队列积压和用户体验下降。P95任务延迟是更有效的预警信号,能在平均任务时长明显恶化之前提前发现瓶颈。实操建议是优先对P95延迟设置告警,再结合持续任务时长数据确认问题根因。
在扩展策略上,横向扩展(增加节点数量)通常优于纵向扩展(增加单节点算力)。由于智能体之间相对独立且单个智能体的计算突发量有限,横向扩展不仅能提升整体吞吐量,还有助于实现高可用、降低成本,并在平台增长时更容易维持目标智能体密度。仅当智能体需要更重的并行计算、共享状态限制了分区能力、内存局部性至关重要或存在许可证约束时,才应考虑纵向扩展。
从业务落地角度看,最先从智能体AI中获益的往往是那些已有明确规则和可量化服务水平的流程,例如代码生成、回归测试、工单分类、市场分析和安全审查。企业推进智能体AI的关键,不在于追求最新模型性能,而在于构建一个可靠的运行环境,使智能体能够在治理约束内稳定运行、有效控制成本,并从试点平稳过渡到规模化生产部署。
要点
- 智能体AI是系统工程问题而非单纯推理问题,任务编排、数据访问、工具调用与治理同等重要
- 容量规划应使用每vCPU智能体密度作为核心指标,而非简单统计智能体总数
- P95任务延迟比平均CPU利用率更能有效预警智能体工作负载的性能瓶颈
- 横向扩展是智能体平台的默认优选策略,纵向扩展仅适用于特定计算密集型场景
- 企业应优先将智能体AI应用于已有明确规则和可量化服务水平的业务流程,以加速从试点到生产的转化
原始标题:Building the enterprise environment for agentic AI
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。