工程 / 工程
用 Amazon Bedrock 与 MCP 服务器打造具备视觉能力的智能体
AWS 发布了一套基于 Amazon Bedrock 的计算机视觉智能体方案,将计算机视觉、Strands Agents 与模型上下文协议(MCP)整合到统一框架中,解决感知、决策与执行之间的割裂问题。方案通过 IAM 角色统一权限管理,结合 Amazon S3 存储、Amazon OpenSearch 检索、Amazon Rekognition 图像分析与 Amazon Bedrock 生成式模型,构建 CV 服务器与 OpenSearch 服务器两个 MCP 服务。用户可通过 Streamlit 聊天界面上传图片或视频,选择 Claude 4 Sonnet 等模型完成对象裁剪、标签检测、内容描述等任务。该方案以标准化接口取代分散的 API 对接,降低集成复杂度,让开发者更便捷地为应用注入视觉智能。
长期以来,AI 落地应用面临一个核心障碍:能看见的系统、能思考的系统与能行动的系统彼此割裂。开发者需要管理多个 API 并编写定制化胶水代码来桥接这些能力,过程既低效、成本高昂,又容易出错。AWS 提出的方案将计算机视觉、Strands Agents 智能体框架与模型上下文协议(MCP)三项关键技术融合,让视觉信息能在统一框架内被捕获、理解并被执行。
整体架构以 IAM 角色为统一安全网关,客户端无需嵌入凭证即可访问多项 AWS 服务。Amazon S3 负责对象存储与数据管理,Amazon OpenSearch 提供索引检索能力,Amazon Bedrock 提供 Claude 等生成式模型以支持文本生成与多模态推理,Amazon Rekognition 则专门处理对象检测等图像分析任务。这种集中式权限模型既简化了访问控制,也提升了多服务协作的效率。
在交互层面,方案提供基于 Streamlit 的聊天界面。用户可在左侧菜单中选择 Claude 4 Sonnet 或 Claude 3.7 Sonnet 等基础模型,并通过拖拽或浏览方式上传图片与视频,支持 PNG、JPG、GIF、WEBP、MP4、AVI、MOV 等多种格式,单文件上限 200 MB。上传完成后,AI 智能体可执行对象裁剪、标签检测、内容描述等任务,并通过底部消息框以自然语言提出进一步分析需求。
后台由两套 MCP 服务器协同工作。CV 服务器整合了 Amazon Rekognition 与 Amazon Bedrock 的多模态能力,通过 describe_image 等工具实现图像理解、目标裁剪与背景移除,并以标准化协议对外暴露;OpenSearch 服务器则承担检索任务。智能体依据系统提示中的工具调用模式,自动选择并串联相应工具,例如先裁剪人、狗等目标,再调用 ui_show_images 统一展示结果。
对于视频分析,智能体可调用 analyze_video 工具并附带监控指令,工具返回的结构化分析结果将呈现在聊天界面中。整套设计以 MCP 作为通用接口,使开发者无需为每个模型与数据源单独构建连接,显著降低了视觉 AI 应用的开发门槛,让更广泛的应用场景能够接入智能视觉能力。
要点
- AWS 将计算机视觉、Strands Agents 与模型上下文协议整合为统一智能体框架,覆盖感知、决策与执行全链路。
- 架构以 IAM 角色统一权限,结合 Amazon S3、Amazon OpenSearch、Amazon Bedrock 与 Amazon Rekognition 多服务协作。
- Streamlit 聊天界面支持图片与视频上传,可选用 Claude 4 Sonnet 等模型完成裁剪、标签检测、内容描述等任务。
- CV 服务器与 OpenSearch 服务器以 MCP 标准化协议对外提供能力,取代分散的 API 对接方式。
- 开发者无需为每个模型与数据源单独构建连接,视觉 AI 应用的集成与扩展门槛显著降低。
原始标题:Agentic vision: Building visual intelligence with Amazon Bedrock and MCP servers
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。