工程 / 工程
用 Amazon Bedrock AgentCore 构建自动化网页洞察提取系统
手动逐一浏览数十个网站提取信息,对设计团队、市场团队和产品经理而言既耗时又低效。基于规则的爬虫虽能部分自动化,却与页面结构高度耦合,一旦网站改版或迁移至 JavaScript 渲染前端,整条管道可能悄然中断数日。Amazon Bedrock AgentCore 提供了一种更具弹性的解决方案:其托管浏览器服务可可靠渲染 JavaScript 密集型页面,配合 Amazon Bedrock 的 AI 分析能力、Amazon OpenSearch Serverless 的向量语义搜索以及 AWS Lambda 的编排调度,构建出一套完整的自动化洞察提取系统。该系统每 15 分钟轮询 RSS 订阅源,通过 Playwright 控制远程浏览器抓取完整页面内容,经 AI 提炼摘要、识别主题与实体后写入可搜索索引,最终通过 React 前端或 MCP 服务器对外提供访问接口。
手动追踪竞品动态、行业报告和监管变化,是许多团队每天都要面对的重复性负担。规则型爬虫虽然提供了一定程度的自动化,但其致命弱点在于与页面 DOM 结构强绑定——网站一旦改版或切换至 JavaScript 渲染框架,爬虫便会静默失效,团队往往数天后才能察觉数据断流。Amazon Bedrock AgentCore Browser 作为托管浏览器服务,从根本上解决了这一脆弱性问题,使整条数据管道在网站结构变化时依然保持稳健。
该解决方案采用事件驱动架构,将内容采集与 AI 处理两个环节彻底解耦。Amazon EventBridge 每 15 分钟触发一个 Lambda 函数,扫描配置好的 RSS 订阅源并通过 URL 哈希值在 Amazon S3 中去重。对于新文章,Lambda 通过 AgentCore 开启远程浏览器会话,使用 Playwright 经由 Chrome DevTools Protocol 连接并控制该浏览器,完整渲染页面、等待动态元素加载、截图并下载图片,最终将 HTML、截图、元数据和图片资源以结构化格式上传至 S3。
内容采集完成后,S3 上传事件自动触发后续处理链路。消息经由 Amazon SQS 队列传递至第二个 Lambda 函数,该函数从原始 HTML 中提取干净文本。对于超过 1 MB 的大型 HTML 文件,系统会先进行简化预处理以降低 token 消耗,从而提升 AI 输出的一致性。Amazon Bedrock 随后对清洗后的内容生成摘要、识别主题与实体、提取可操作洞察,并生成向量嵌入,整个过程无需人工介入。
经 AI 丰富后的结果被索引至 Amazon OpenSearch Serverless,同时支持关键词检索和向量语义搜索。这意味着用户不仅可以精确匹配关键词,还能通过语义相似度找到相关内容,大幅提升信息检索的召回质量。前端用户通过 Amazon Cognito 认证后访问部署在 Amazon ECS Fargate 上的 React 应用;开发者则可通过同样运行在 Fargate 上、经 Amazon CloudFront 分发的 MCP 服务器以编程方式接入系统。
该架构的适用场景远不止设计团队的竞品追踪。竞争情报团队可监控对手博客、产品公告和新闻稿,AI 能自动识别新功能、定价变化或战略调整;市场研究人员可聚合行业新闻和分析师报告,发现新兴技术趋势;合规团队可持续监控监管网站,及时捕捉可能影响业务的政策变化。内容采集与 AI 处理的独立扩展能力,使系统在监控数十个 RSS 源时依然保持高效,SQS 死信队列则为处理失败提供自动重试保障。
完整实现代码已开源至 GitHub,开发者可直接参考部署。对于希望构建类似系统的团队而言,该方案的核心价值在于三点:AgentCore 托管浏览器消除了 JavaScript 渲染的不确定性,事件驱动架构让各环节独立扩展互不干扰,向量嵌入与语义搜索的结合则将原本散落各处的网页内容转化为可持续查询的知识库,真正实现从信息采集到洞察生产的全链路自动化。
要点
- Amazon Bedrock AgentCore Browser 以托管远程浏览器方式渲染 JavaScript 密集型页面,相比规则型爬虫对网站改版具有更强的抗干扰能力
- 事件驱动架构将 RSS 采集、浏览器渲染、AI 分析三个环节解耦,各层可独立扩展,SQS 死信队列提供自动重试保障
- Amazon Bedrock 负责生成摘要、识别主题实体并产出向量嵌入,OpenSearch Serverless 同时支持关键词与语义向量双模式检索
- 系统通过 MCP 服务器对外暴露标准接口,AI 助手和外部工具可通过统一协议接入,具备良好的可扩展性
- 该架构适用于竞品监控、市场研究、内容聚合和合规追踪等多种企业级场景,完整代码已在 GitHub 开源
原始标题:Automated web insight extraction with Amazon Bedrock AgentCore
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。