产业 / 媒体
谷歌Gemini引入智能体视频分析,Token用量最高降低88%
谷歌为Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite三款模型引入了基于智能体的视频分析能力。与此前每秒固定采样一帧的静态处理方式不同,新方案允许模型自主判断需要分析视频的哪些片段、以何种速度和方式进行分析,并按需调取画面帧、音频或字幕。谷歌表示,这一改变在1H-VideoQA和LVBench基准测试中将Token用量降低了88%,成本下降66%,同时准确率略有提升。该功能目前已通过Gemini API向开发者开放,支持视频上传和YouTube视频分析,无需额外付费。谷歌还计划将其整合进Gemini应用及YouTube的「Ask YouTube」功能,让用户获得与视频实际内容更紧密结合的答案。这一能力对处理10分钟教程到数小时录像等长视频场景尤为显著。
谷歌近日宣布,旗下Gemini Flash系列模型正式获得基于智能体的视频分析能力。此前,Gemini在处理视频时默认以每秒一帧的固定频率进行采样,开发者虽可通过API调整参数,但本质上仍属于静态逐帧扫描。新方案彻底改变了这一逻辑:模型不再被动地按固定节奏处理画面,而是主动搜索视频中与任务相关的片段,并自行决定以何种粒度和方式进行分析。
在技术实现上,新系统让模型的推理过程与原生视频工具直接挂钩。模型可以通过内部工具仅加载视频文件中真正需要的部分,并在一个循环中选择性地获取特定时间段的帧、音频或字幕。这种方式此前需要开发者手动构建,而现在模型可以完全自主完成。对于不足一秒的瞬间变化,例如画面切换或状态突变,模型也能精准捕捉,这使得自动化视频剪辑的精度大幅提升。
效率提升在长视频场景中最为突出。过去,处理数小时的录像意味着要消耗数百万个Token,开发者不得不在高成本与丢失关键细节之间做出取舍。新方案通过对可疑时间窗口进行高帧率重采样来识别异常,并能在长时间跨度内准确追踪重复动作和特定对象。谷歌自有基准测试LongVideoBench的结果显示,Gemini 3.7 Flash在采用智能体分析模式后,综合质量评分最高,同时在准确率与成本效率之间取得了最佳平衡。
这一能力的技术根基可追溯至今年1月谷歌为Gemini 3 Flash推出的「智能体视觉」功能。彼时,模型已能编写并执行Python代码对图像进行缩放、裁剪和标注,并在「思考-行动-观察」循环中逐步验证结果。去年12月发布Gemini 3 Flash时,谷歌便将视频的视觉与空间推理列为即将推出的能力,此次视频智能体分析正是这一路线图的延续。
该功能目前已在Google AI Studio和Gemini企业智能体平台上通过Gemini API正式上线,支持视频文件上传和YouTube视频两种输入方式。开发者只需在API配置中将处理模式设置为「agentic」,按标准Token费率计费,无需支付额外费用。谷歌还计划在未来数月内将智能体视频分析能力引入面向普通用户的Gemini应用,并为YouTube播放页面的「Ask YouTube」功能提供支持,使其回答更贴近视频的实际内容。
要点
- Gemini Flash系列模型新增智能体视频分析模式,模型可自主决定分析视频的哪些片段,无需逐帧扫描
- 在基准测试中,Token用量最高降低88%,成本下降66%,准确率同步小幅提升
- 新功能对长视频处理效果最为显著,可精准捕捉不足一秒的画面变化并追踪长时段内的对象
- 该功能已通过Gemini API向开发者开放,按标准Token费率计费,无额外收费
- 谷歌计划将其整合进Gemini应用及YouTube的Ask YouTube功能,面向普通用户推出
原始标题:Google Gemini's new agent-based video analysis cuts token usage by up to 88 percent
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。