Google 于 2026 年 9 月 1 日开启了 Gemini 的代理视频理解:该模型现在搜索和检查视频片段,而不是对每一帧进行采样,长镜头的标记数量减少了 88%。

2026 年 9 月 1 日,Google 更改了 Gemini 模型读取视频的方式。到目前为止,API 以固定速率(默认情况下每秒一帧)对剪辑进行采样,并将每一帧传递给模型,无论其中的任何内容是否重要。新模式让 Gemini 自行决定观看视频的哪些片段、浏览视频的速度以及对于给定问题是否依赖图片、音频或文字记录。谷歌称之为代理视频理解。
现在可以通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 在上传的文件和 YouTube 链接上使用。三种型号支持:Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。没有单独的功能费用。标准 Gemini API 令牌定价适用,因此节省的金额显示为较小的令牌数量,而不是账单上的新行。

其覆盖的人群是那些通过 Gemini 批量运行视频的人:观看屏幕录像以查找错误的质量保证管道、扫描上传内容的审核系统、从长镜头中提取片段的分析工作。在旧模型下,以每秒一帧采样的两小时录音大约有 7,200 帧,即使答案存在于单个 30 秒的窗口中,您也需要对每一帧进行编码和推理。
这就是前后。现在,通过配置更改而不是模型迁移来启动相同的工作:您将视频处理模式设置为 代理的 在 API 请求中。无需重新培训,无需新的 SDK,无需等待新模型发布。对于已经在长视频上投入资金的团队来说,这是罕见的成本杠杆,需要花费一个下午的时间才能完成。

这种转变是从摄取到调查。固定速率阅读器将视频视为一堵帧墙,并从前到后地阅读它。主观能动的读者将双子座的推理与一套本地视频工具结合起来,然后像浏览录音一样使用它们:跳到可能的部分,在细节密集的地方放慢速度,当视觉效果没有给出答案时插入音频或文字记录,跳过显然没有答案的部分。
因为模型会选择观看什么,所以收益会随着长度的增加而增加。谷歌表示,这种影响在长视频上最为明显,它定义为十分钟到几个小时,而在短片上影响最小,因为一开始就没有太多可跳过的内容。

Google 自己的基准测试报告显示,与旧的固定速率处理相比,令牌减少了 88%,成本降低了 66%,准确性提高了 7%。将“最多”一词理解为它们的上限。这些是谷歌对标准视频分析基准进行内部测试的最佳案例,根据其每秒一帧的默认值进行测量,并且它们聚集在长格式端。三分钟的剪辑看不到 88%。
准确性说明是更有趣的主张。观看较少的帧,但正确的帧比观看所有帧的得分更高,这表明固定速率默认设置使模型淹没在长镜头的冗余帧中。不过,这些都是供应商数据,于 2026 年 9 月检查,尚未发布独立基准。将方向视为可信的,并将确切的上限视为营销数字,直到 Google 以外的人复制它。谷歌还指出,早期的合作伙伴已经在生产中运行它,包括 Ponder、Revyl、Mosaic 和 Resemble.AI,尽管这些公司引用的具体数字位于公告页面的图像内,而不是可引用的文本中。

谷歌将其标记为预览版,因此预计行为和数字会发生变化。有两件事已宣布但尚未生效。第一个是消费者 Gemini 应用程序,其中代理视频旨在覆盖 Flash 和 Flash-Lite 的日常用户。第二个是YouTube在观看页面上的“询问YouTube”功能,该功能可以让观看者以同样的方式查询视频。谷歌将两者定为几个月内到达,而不是今天发货。
目前,这个故事更狭窄、更具体:在 Gemini 上拥有视频管道的开发人员可以通过翻转一个设置来减少长剪辑上的代币使用,并且可以从本周开始。完整的详细信息可以在 Google 上找到 公告帖。
