产业 / 官方
Gemini 推出智能体视频理解功能,Token 消耗最高降低 88%
Google DeepMind 正式为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 三款模型推出智能体视频理解功能。与传统静态处理方式不同,该功能允许模型主动决定观看视频的哪些片段、以何种速度及通过何种模态(视频帧、音频或文字转录)进行分析,从而只提取真正需要的信息。基准测试显示,启用该功能后,视频分析的 Token 消耗最高降低 88%,成本最高降低 66%,准确率最高提升 7%。这一优势在长视频场景下尤为突出,涵盖十分钟教程到九十分钟讲座乃至数小时录像。该功能现已通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 上线,支持上传视频及 YouTube 视频,无需额外付费,只需在 API 配置中将处理模式设为「agentic」即可启用。
Google DeepMind 于 2026 年 9 月 1 日正式发布智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 三款模型。该功能的核心思路与此前推出的智能体视觉能力一脉相承——将代码执行与模型原生图像理解相结合——此次则进一步延伸至视频领域,赋予模型对视频内容进行主动、目标导向分析的能力。
传统静态处理方式以固定帧率(默认每秒 1 帧)摄取视频流,模型无法自主选择关注重点。智能体视频理解则通过内部工具调用构建一个智能体循环,让 Gemini 能够动态搜索、扫描并精细检视目标视频片段,按需在视觉帧、音频和文字转录之间切换,仅加载真正相关的时间段与信号,从而大幅减少冗余计算。
在标准视频分析基准测试中,Gemini 3.7 Flash 启用智能体理解后,Token 消耗最高降低 88%,成本最高降低 66%,准确率最高提升 7%。在三款支持模型中,Gemini 3.7 Flash 综合表现最优,在质量与成本效率的帕累托前沿上处于领先位置,尤其适合对长视频进行高精度、低成本的批量处理。
该功能带来了多项具体能力提升:亚秒级时刻检索可精准定位静态帧率下容易遗漏的瞬间状态变化;长视频「大海捞针」搜索能在数小时录像中回答复杂问题而无需消耗数百万 Token;异常检测可对感兴趣的时间窗口以更高帧率重采样,捕捉快速运动与细微视觉异常;动作与物体计数则能准确追踪重复动作和不同物体。
在商业落地层面,该功能已通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 上线,采用标准 Token 定价,不收取额外功能费用。开发者只需在 API 配置中将 processing 参数设为「agentic」即可启用。与此同时,Google 计划将该功能逐步推广至 Gemini 应用的全体用户,并在未来数月内为 YouTube 的「Ask YouTube」功能提供支持,以视觉内容为基础提供更高质量的问答体验。
要点
- 智能体视频理解已在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线,Token 消耗最高降低 88%,成本最高降低 66%,准确率最高提升 7%。
- 与固定帧率的静态处理不同,该功能通过智能体循环让模型主动决定分析哪些片段,按需在视频帧、音频和文字转录之间切换。
- 核心能力包括亚秒级时刻检索、长视频复杂问答、高帧率异常检测和精准动作计数,尤其适合长视频批量处理场景。
- 功能采用标准 Token 定价,无额外收费,开发者在 API 配置中将 processing 设为「agentic」即可启用。
- Google 计划将该功能扩展至 Gemini 应用全体用户及 YouTube 的「Ask YouTube」功能,进一步扩大受益范围。
原始标题:Introducing agentic video understanding with Gemini
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。