AI资讯 / 工程

工程 / 工程

用自然语言秒级查询视频内容

AWS Machine Learning

媒体、安防、保险和专业服务行业每天产生大量视频内容,但人工审看效率极低。AWS 机器学习团队提出了一种基于智能体架构的对话式视频智能方案:通过 Strands Agents SDK 构建单一 AI 智能体,在运行时根据用户问题动态决定调用 Amazon Bedrock、Amazon Rekognition 还是 Amazon Transcribe,无需为每类问题预先搭建独立处理流水线。用户上传视频后,可直接用自然语言提问,例如「这次会议做了哪些决策」或「画面中是否出现了这个人」,系统对已分析内容的响应时间不足一秒,新视频的初次分析则需 5 至 10 分钟。某大型媒体娱乐公司在 AWS 专业服务项目中采用该方案后,超过 200 段多小时录音的人工审看时间减少了约 80%。完整实现代码已在 GitHub 开源。

视频内容正在以远超人工审看能力的速度积累。会议录像堆满共享云盘,安防摄像头持续录制却无人回看,现场巡检视频在初次查阅后便长期闲置于对象存储中。这些视频往往蕴含高价值信息——三周前讨论的设计决策、某人到达门口的精确时刻、车辆碰撞前的事件序列——但传统方式要获取这些信息,往往需要耗费数小时手动观看,或为每类问题单独开发定制化机器学习流水线。

AWS 提出的解决方案核心在于将流水线的构建从开发时推迟到运行时。系统使用 Strands Agents SDK 创建一个单一 AI 智能体,该智能体以 Amazon Bedrock 上的 Claude Sonnet 或其他支持工具调用的大语言模型为推理引擎。当用户提出问题时,智能体自主判断应调用哪项服务:涉及语音内容时调用 Amazon Transcribe,涉及画面内容时调用 Amazon Rekognition,需要综合分析时则调用 Amazon Bedrock Data Automation(BDA)一次性完成视频摘要、章节检测和全文转录。

智能体的路由逻辑完全由模型驱动,而非硬编码的应用逻辑。Amazon Rekognition 负责检测视频帧中的物体、场景、活动和人脸;Amazon Transcribe 支持超过 100 种语言的自动识别与说话人分离;BDA 则提供一站式综合分析能力。所有上传的视频和分析结果均存储在 Amazon S3 中,并通过用户级前缀实现多租户隔离。智能体还维护完整的对话历史,后续追问无需重新处理已分析的内容,对已缓存结果的响应时间可低于一秒。

在实际落地案例中,某大型媒体娱乐公司将该方案应用于发现会议录音的内容挖掘。顾问团队可直接查询录音内容,提取设计决策、行动项和利益相关方立场,无需逐段回听。根据该公司内部对比数据,超过 200 段多小时录音的每段分析师工时显著下降,整体人工审看时间减少约 80%。这一效率提升来自智能体对重复性信息检索工作的自动化替代。

该架构的扩展性是其重要优势之一。由于智能体通过工具描述而非硬编码逻辑来选择服务,新增能力只需注册新工具即可,无需改动核心编排逻辑。团队可以在视频分析基础上叠加文档处理、数据库查询或外部 API 调用,使同一智能体逐步演化为跨模态的企业知识检索系统。AWS 同时建议在生产环境中接入 Amazon Bedrock Guardrails,对人脸匹配和监控类场景实施内容过滤和答案溯源检查,以满足负责任 AI 的合规要求。

要点

  • 单一 AI 智能体在运行时动态决定调用哪项 AWS 服务,彻底取代了为每类问题单独构建流水线的传统开发模式。
  • 已缓存内容的查询响应时间低于一秒,新视频初次分析需 5 至 10 分钟,兼顾了实时交互体验与深度分析能力。
  • 某媒体公司实测显示,200 余段多小时录音的人工审看时间减少约 80%,验证了该方案在企业级场景中的实际价值。
  • 架构基于工具描述驱动路由,新增服务只需注册工具,扩展成本极低,可从视频分析延伸至跨模态企业知识检索。
  • 生产部署应配合 Amazon Bedrock Guardrails 使用,尤其在涉及人脸识别和安防监控的场景中需强制执行负责任 AI 控制措施。
查看原始来源

原始标题:Agentic conversational video intelligence built on AWS

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。