技术进展

谷歌推出智能体视频理解功能

Heooo 09月02日20时33分 6 阅读

「谷歌在最新Gemini模型中推出智能体视频理解功能,通过动态搜索与工具结合,在长视频分析中可将Token消耗降低最高88%、成本降低66%,同时准确率提升最高7%,并已在API中上线。」

谷歌近日宣布在最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解功能。该功能旨在提升视频分析的准确率,同时大幅减少视频分析过程中的 Token 使用量和成本,为开发者处理长视频内容提供了新的技术路径。

与传统的静态处理方式不同,传统方式中模型按固定帧率读取视频,默认为每秒一帧,虽可通过 API 调整,但总体上仍属于被动采样。而智能体视频理解将模型核心推理与原生视频工具结合,使 Gemini 能够在视觉帧、音频和转录文本中主动进行动态搜索、扫描和检查,聚焦于需要分析的目标视频片段。这种主动机制让模型可以自行决定观看什么内容、以何种速度观看,以及通过哪种模态获取信息,只提取必要的片段和信号。

在标准视频分析基准测试中,搭载智能体视频理解的 Gemini 模型展现出显著优势:分析成本最高可降低 66%,Token 消耗量最高可降低 88%,准确率最高可提升 7%。这种效率提升在长视频场景中尤为突出,因为传统静态处理往往迫使开发者在高 Token 成本和丢失关键细节之间进行取舍,而新功能打破了这一矛盾。

谷歌指出,在多个 Flash 系列模型中,Gemini 3.7 Flash 搭配智能体视频理解可获得最佳的整体质量,同时在质量与成本效率之间达到最优平衡。在视频理解任务中,该组合位于准确率与成本的帕累托最优前沿,意味着没有其他配置能在不牺牲一方表现的情况下实现更好的综合效果。

智能体视频理解还为开发者带来了多项新能力。首先是亚秒级时刻检索,能够精准定位在每秒一帧采样下容易错过的瞬间状态变化和紧凑剪辑边界,适用于高精度自动化视频编辑。其次是长视频“大海捞针”式搜索,可在数小时长的视频中回答复杂查询,而无需消耗数百万个 Token。第三是异常检测,可对感兴趣的时间窗口以更高帧率重新采样,检查快速运动和细微视觉伪影。第四是动作与物体计数,能够随时间精准跟踪重复物理动作和不同物体。

目前该功能已在 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 中上线,支持视频上传和 YouTube 视频分析。开发者只需在 API 配置中将处理模式设置为“agentic”即可启用,且该功能使用标准 Gemini API Token 定价,不收取额外费用。谷歌还计划将这一能力逐步推广到更广泛的产品生态中,Gemini 应用中的 Flash 和 Flash-Lite 模型用户将很快获得支持,未来数月内,基于视频画面的“Ask YouTube”功能也将借助智能体视频理解实现更高质量的回答。

# 谷歌 # Gemini # 视频理解 # AI工具

来源:Heooo AI工具导航