AI资讯 / 工程

工程 / 工程

nOps借助Amazon Bedrock AgentCore将FinOps智能体上线周期压缩75%

AWS Machine Learning

云成本优化平台nOps近期对其FinOps AI智能体Clara进行了架构重构,将底层基础设施从自管的Amazon EKS集群(运行LangChain和LangGraph)迁移至Amazon Bedrock AgentCore。这一转变使产品上线周期从原来的10至12个月大幅压缩至4个月,降幅达75%。新架构以Bedrock AgentCore作为托管运行时与编排层,结合Databricks Lakehouse Metric Views提供受治理的语义分析层,并通过Databricks Lakebase存储持久化应用状态。前端采用Vercel托管的Next.js应用,异步工作流则借助Amazon DynamoDB、SNS、SQS及API Gateway WebSocket实现实时推送。目前nOps管理的云支出规模已超过40亿美元,新架构帮助其在多云环境下更高效地为客户优化Reserved Instances和AWS Savings Plans等承诺用量资源。

nOps是一家面向AWS、GCP和Azure提供云成本优化服务的平台,其核心产品之一是FinOps AI智能体Clara。随着客户规模扩大和产品功能增多,原有基于Kubernetes、LangChain和LangGraph构建的自管基础设施逐渐暴露出明显瓶颈:API调用链路带来的长上下文导致响应延迟上升,多层编排与可观测性组件使系统复杂度持续攀升,工程团队大量时间被基础设施维护所消耗,真正用于产品创新的资源严重不足。

为解决上述问题,nOps决定将Clara迁移至Amazon Bedrock AgentCore。AgentCore提供托管的智能体运行时、内置记忆管理和编排能力,同时支持开发者自由选择框架和模型。nOps选择基于Strands框架构建单一智能体架构,避免了多智能体路由带来的延迟和错误传播问题,使工具调度更具确定性,团队也得以将精力集中在业务逻辑而非基础设施层面。

新架构在数据层引入了Databricks Lakehouse Metric Views,为Clara提供受治理的语义分析层,确保分析结果的准确性和一致性。应用状态(包括会话、画布和组件配置)则存储在Databricks Lakebase(无服务器PostgreSQL)中,实现跨浏览器刷新和重连的上下文持久化。会话作用域绑定到画布而非临时HTTP会话,用户无需重复解释背景即可延续上次的分析线索。

在流式响应体验方面,nOps构建了一个自定义合并层,位于Strands异步流与Server-Sent Event输出之间,同时处理三项任务:通过心跳保持长时工具执行期间的连接存活、利用词边界感知缓冲将模型输出的小增量合并为可读文本块以避免界面闪烁,以及将实时画布更新事件插入同一数据流。Clara还采用三种记忆策略——语义事实、用户偏好和画布摘要,使其能够随时间学习每位用户的数据交互习惯。

异步工作流层通过Amazon DynamoDB进行任务追踪,结合SNS和SQS消息通知,以及API Gateway WebSocket实现长时分析任务的实时UI更新。整个后端基础设施(运行时、记忆、护栏、队列和工作函数)均通过单一AWS CDK堆栈定义,显著降低了部署和运维复杂度。最终,这套架构将Clara的生产上线周期从原来的10至12个月压缩至4个月,同时提升了响应质量,并为nOps管理超过40亿美元云支出的客户群提供了更稳定可靠的服务体验。

要点

  • 迁移至Amazon Bedrock AgentCore后,nOps将FinOps智能体的上线周期从10-12个月缩短至4个月,降幅达75%。
  • 单一智能体架构配合直接工具访问,避免了多智能体路由的延迟和错误传播,使工具调度更具确定性。
  • Databricks Lakehouse Metric Views作为受治理的语义分析层,从根本上解决了原有API数据路径与智能体分析需求不匹配的问题。
  • 三种记忆策略(语义事实、用户偏好、画布摘要)使Clara能够跨会话持久化上下文,提升用户连续分析体验。
  • 将基础设施定义收敛至单一CDK堆栈,显著降低了运维复杂度,释放工程团队专注于产品创新。
查看原始来源

原始标题:How nOps shipped FinOps agents 75% faster with Amazon Bedrock AgentCore

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。