发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

谷歌为Gemini模型添智能体视频理解功能,降成本提精度助力视频处理

2026-09-03来源:快讯编辑:瑞雪

谷歌近日宣布,为Gemini 3.7 Flash、3.6 Flash以及3.5 Flash-Lite模型引入了一项创新的智能体视频理解功能。这一功能不仅显著提升了模型在视频分析任务中的准确率,还大幅降低了资源消耗与使用成本。值得注意的是,该功能遵循Gemini API的标准Token计费规则,不会额外增加使用费用。

传统上,模型处理视频主要依赖静态处理模式,即按照固定帧率读取视频内容,默认帧率为1帧每秒。尽管开发者可以通过应用程序接口调整这一参数,但这种方式在处理长视频时往往面临高额Token开销与遗漏关键细节的权衡难题。谷歌此次推出的智能体视频理解功能,通过将模型核心推理能力与原生视频工具相结合,实现了从视频视觉帧、音频及转录文本中动态检索、扫描和核验目标片段的能力。

基准测试数据显示,搭载智能体视频理解功能的Gemini模型在视频分析成本上最高可降低66%,Token消耗量最高减少88%,同时分析准确率最高提升7%。这一技术优势在长视频处理场景中尤为显著,有效解决了开发者在处理长视频时面临的成本与细节保留的矛盾。谷歌指出,Gemini 3.7 Flash与新功能的结合,在分析质量与成本效率之间实现了最佳平衡,处于视频理解任务准确率与成本的帕累托最优前沿。

智能体视频理解功能赋予了模型自主决策能力,使其能够根据任务目标自主选择读取内容、播放速度,并灵活选取视频帧、音频及转录文本等信息模态。这一转变意味着,以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具自动完成,从而大幅缩减了开发工作量。

该功能还具备多项实用特性,如支持亚秒级时刻检索,能够精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,为高精度自动化视频编辑提供了有力支持。它还能对长达数小时的长视频进行复杂内容检索,而无需消耗海量Token资源。针对快速运动画面或细微视觉异常,该功能可通过调高指定时间窗口的采样帧率进行检测,同时实现对时序下重复动作及多类物体的精准计数。

目前,这项功能已在Google AI Studio及Gemini企业智能体平台的Gemini应用程序接口上线,支持本地视频上传与YouTube视频解析。开发者只需在接口配置中将处理模式设置为“agentic”,即可轻松启用该能力。

根据谷歌的规划,这项技术能力还将逐步向面向普通用户的产品推广。未来,该功能将推送至Gemini应用全部Flash、Flash-Lite模型用户。在接下来的数月内,智能体视频理解还将赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型提供更贴合视频画面内容的问答结果。

美光“近GPU NAND”技术探索:为人工智能大模型运行开辟硬件新路径
来源:环球网 这项被称作“近GPU NAND”的技术,力求在存储密度与耐久性能之间实现平衡优化,主要面向非极致低延迟、超高带宽类业务场景。作为介于显存与普通存储之间的全新高速缓冲层级,该技术对于运行超大规模…

2026-09-03

从大国重器到机器人“关节”:“雨花造”螺丝钉的硬核进化之路
“做大国重器上永不松动的螺丝钉”——这句话申亿喊了十几年,也做了十几年。难点有两个:一是耐候钢冷成型工艺的稳定性,二是现场装配的技术指导。 也是在这一年,申亿在雨花经开区“三新”成果发布会上亮出机器人核心零部…

2026-09-03

马斯克预测:2036年全球人形机器人或超10亿台,AI助力经济大增长
联合国此前预测,到2037年全球人口会达到约90亿,按此估算,届时相当于平均每9人就拥有一台人形机器人。马斯克称,十亿台人形机器人的生产力将超过所有人类生产力的总和。(剪辑 匡萍) 责编:曾梓民 一审:匡萍…

2026-09-03

华为Mate90系列入网引关注 5G回归配大容量电池影像或有新突破
此前,华为Mate系列部分机型由于受到外部环境影响,在通信能力方面有所限制,而如今入网信息中出现5G相关标识,也让市场再次关注华为在移动通信领域的发展进展。除了通信能力外,曝光信息还显示,华为Mate 90…

2026-09-03