AI资讯 / 工程

工程 / 工程

用 Amazon Bedrock 与 MCP 服务器打造具备视觉能力的智能体

AWS Machine Learning

AWS 发布了一套基于 Amazon Bedrock 的计算机视觉智能体方案,将计算机视觉、Strands Agents 与模型上下文协议(MCP)整合到统一框架中,解决感知、决策与执行之间的割裂问题。方案通过 IAM 角色统一权限管理,结合 Amazon S3 存储、Amazon OpenSearch 检索、Amazon Rekognition 图像分析与 Amazon Bedrock 生成式模型,构建 CV 服务器与 OpenSearch 服务器两个 MCP 服务。用户可通过 Streamlit 聊天界面上传图片或视频,选择 Claude 4 Sonnet 等模型完成对象裁剪、标签检测、内容描述等任务。该方案以标准化接口取代分散的 API 对接,降低集成复杂度,让开发者更便捷地为应用注入视觉智能。

长期以来,AI 落地应用面临一个核心障碍:能看见的系统、能思考的系统与能行动的系统彼此割裂。开发者需要管理多个 API 并编写定制化胶水代码来桥接这些能力,过程既低效、成本高昂,又容易出错。AWS 提出的方案将计算机视觉、Strands Agents 智能体框架与模型上下文协议(MCP)三项关键技术融合,让视觉信息能在统一框架内被捕获、理解并被执行。

整体架构以 IAM 角色为统一安全网关,客户端无需嵌入凭证即可访问多项 AWS 服务。Amazon S3 负责对象存储与数据管理,Amazon OpenSearch 提供索引检索能力,Amazon Bedrock 提供 Claude 等生成式模型以支持文本生成与多模态推理,Amazon Rekognition 则专门处理对象检测等图像分析任务。这种集中式权限模型既简化了访问控制,也提升了多服务协作的效率。

在交互层面,方案提供基于 Streamlit 的聊天界面。用户可在左侧菜单中选择 Claude 4 Sonnet 或 Claude 3.7 Sonnet 等基础模型,并通过拖拽或浏览方式上传图片与视频,支持 PNG、JPG、GIF、WEBP、MP4、AVI、MOV 等多种格式,单文件上限 200 MB。上传完成后,AI 智能体可执行对象裁剪、标签检测、内容描述等任务,并通过底部消息框以自然语言提出进一步分析需求。

后台由两套 MCP 服务器协同工作。CV 服务器整合了 Amazon Rekognition 与 Amazon Bedrock 的多模态能力,通过 describe_image 等工具实现图像理解、目标裁剪与背景移除,并以标准化协议对外暴露;OpenSearch 服务器则承担检索任务。智能体依据系统提示中的工具调用模式,自动选择并串联相应工具,例如先裁剪人、狗等目标,再调用 ui_show_images 统一展示结果。

对于视频分析,智能体可调用 analyze_video 工具并附带监控指令,工具返回的结构化分析结果将呈现在聊天界面中。整套设计以 MCP 作为通用接口,使开发者无需为每个模型与数据源单独构建连接,显著降低了视觉 AI 应用的开发门槛,让更广泛的应用场景能够接入智能视觉能力。

要点

  • AWS 将计算机视觉、Strands Agents 与模型上下文协议整合为统一智能体框架,覆盖感知、决策与执行全链路。
  • 架构以 IAM 角色统一权限,结合 Amazon S3、Amazon OpenSearch、Amazon Bedrock 与 Amazon Rekognition 多服务协作。
  • Streamlit 聊天界面支持图片与视频上传,可选用 Claude 4 Sonnet 等模型完成裁剪、标签检测、内容描述等任务。
  • CV 服务器与 OpenSearch 服务器以 MCP 标准化协议对外提供能力,取代分散的 API 对接方式。
  • 开发者无需为每个模型与数据源单独构建连接,视觉 AI 应用的集成与扩展门槛显著降低。
查看原始来源

原始标题:Agentic vision: Building visual intelligence with Amazon Bedrock and MCP servers

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。