工程 / 工程
Amazon Bedrock 知识库接入 Marengo 3.0,视频与图像语义搜索全面开放
Amazon Bedrock 知识库现已正式支持 TwelveLabs Marengo Embed 3.0 作为嵌入模型,为视频、图像和音频内容带来全托管的语义搜索能力。此前,对视频进行语义检索需要自行拼接转录服务、帧提取管道、嵌入模型、向量数据库等多个组件,工程复杂度极高。Marengo Embed 3.0 是一款多模态嵌入模型,能够将视频、音频、图像和文本联合编码至 512 维向量空间。借助 Amazon Bedrock 的托管知识库(Managed MKB),系统可自动完成分段、帧采样、音频转录及向量生成,用户只需将媒体文件上传至 Amazon S3,完成同步后即可通过自然语言进行查询。该能力适用于体育分析、媒体资产管理、安防监控、教育培训和零售等多个行业场景,大幅降低了视频智能检索的技术门槛。
视频资产长期以来难以按语义进行检索,媒体、体育、安防、教育等行业的团队往往只能依赖关键词标签或人工标注来定位特定片段。一个典型需求是在数小时的比赛录像中找到「下半场的点球」,而传统方案需要串联转录、帧提取、嵌入模型和向量数据库等多个独立系统,维护成本极高。Amazon Bedrock 知识库的全托管 RAG 服务正是为解决这一痛点而设计,此次引入 Marengo Embed 3.0 进一步补全了多模态检索能力。
Marengo Embed 3.0 由 TwelveLabs 开发,是一款将视频、音频、图像和文本统一编码至 512 维紧凑向量空间的多模态嵌入模型。托管知识库在接收媒体文件后,会自动对内容进行分段(默认每段 4 秒)、提取帧、转录音频,并为每个片段生成 Marengo Embed 3.0 嵌入向量,最终写入向量索引。整个过程无需用户进行任何预处理,支持 MP4、MOV 视频格式以及 JPEG、PNG 图像格式。
在实际操作流程上,用户首先将媒体文件上传至 Amazon S3 存储桶,随后在 Amazon Bedrock 控制台创建托管知识库,在嵌入模型选项中选择 TwelveLabs Marengo Embed 3.0,并配置 S3 数据源路径。知识库创建完成后,点击同步即可启动摄取任务。控制台内置的测试界面支持直接输入自然语言查询,返回结果包含片段起止时间、来源 URI 和嵌入类型等元数据,便于下游应用精准定位相关内容。
以 2022 年 FIFA 世界杯决赛的 10 分钟片段为例,查询「这场足球比赛中的点球」后,系统能够返回按相关性排序的视频片段,并在时间轴上标注对应位置。开发者可通过 Amazon Bedrock Retrieve API 将该能力集成至自有应用,也可将知识库作为 Amazon Bedrock AgentCore 的网关目标,构建更复杂的智能体工作流。
从行业应用角度来看,该能力覆盖范围广泛:体育分析团队可跨赛季检索特定战术或球员动作;媒体公司可对海量存档内容进行语义管理;安防场景下可按事件描述检索监控录像;教育机构可按知识点定位课程片段;零售商则可在产品演示视频中快速找到特定功能展示。Marengo Embed 3.0 在 Amazon Bedrock 知识库中的正式开放,标志着多模态语义检索正式进入全托管时代,企业无需再为底层基础设施的搭建与维护投入大量资源。
要点
- TwelveLabs Marengo Embed 3.0 正式成为 Amazon Bedrock 知识库的嵌入模型选项,支持视频、图像、音频和文本的统一语义检索。
- 托管知识库自动处理媒体分段、帧提取、音频转录和向量生成,用户只需上传文件并同步,无需自建复杂管道。
- Marengo Embed 3.0 将多模态内容编码至 512 维向量空间,默认以 4 秒为单位对音视频进行分段索引。
- 检索结果包含片段起止时间和来源元数据,可通过 Retrieve API 直接集成至下游应用或 AgentCore 智能体工作流。
- 该能力适用于体育分析、媒体资产管理、安防监控、教育培训和零售等多个行业的视频语义检索场景。
原始标题:Video and image search in Amazon Bedrock Knowledge Base using Marengo 3.0
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。