巨人天成
产经 科技 企业 数据 峰会 快讯 商业

谷歌智能体视频理解功能上线,Gemini模型视频分析更高效成本更低

2026-09-03来源:快讯编辑:瑞雪

谷歌近日宣布,为Gemini 3.7 Flash、3.6 Flash以及3.5 Flash‑Lite模型引入了一项突破性的智能体视频理解功能。这一创新技术不仅显著提升了模型对视频内容的分析能力,还在降低资源消耗和成本方面表现出色,为视频处理领域带来了新的变革。

传统视频处理方式多采用静态模式,即按照固定帧率读取视频内容,默认帧率为1FPS。开发者虽然可以通过应用程序接口调整参数,但这种方式在处理长视频时往往面临高额Token开销与遗失关键视频细节的矛盾。谷歌此次推出的智能体视频理解功能,将模型的核心推理能力与原生视频工具相结合,能够从视频的视觉帧、音频和转录文本中动态检索、扫描和核验目标片段,有效解决了这一难题。

基准测试数据显示,搭载智能体视频理解能力的Gemini模型在视频分析方面取得了显著进展。最高可将视频分析成本降低66%,Token消耗量减少88%,同时分析准确率提升最高达7%。这一技术优势在长视频处理场景中尤为突出,开发者无需再在成本与细节之间做出艰难选择。其中,Gemini 3.7 Flash与新功能的结合表现尤为出色,实现了分析质量与成本效率的平衡,处于视频理解任务准确率与成本的帕累托最优前沿。

智能体视频理解功能赋予了模型自主决策能力,使其能够根据任务目标自主选择读取内容、播放速度以及信息模态。模型可以智能地选取视频帧、音频和转录文本等,只提取任务所需片段与信号,从而大幅缩减了开发工作量。以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具自动完成。

该功能还具备多项实用特性。它支持亚秒级时刻检索,能够精准捕捉固定帧率下容易遗漏的状态变化和剪辑边界,为高精度自动化视频编辑提供了有力支持。同时,它还能对长达数小时的长视频进行复杂内容检索,而无需消耗海量Token资源。该功能还能针对指定时间窗口调高采样帧率,完成快速运动画面和细微视觉异常的检测,并对时序下的重复动作和多类物体实现精准计数。

目前,这项功能已在Google AI Studio和Gemini企业智能体平台的Gemini应用程序接口上线。开发者只需在接口配置中将处理模式设置为“agentic”,即可轻松开启这一能力。该功能支持本地视频上传和YouTube视频解析,为开发者提供了更加便捷的视频处理方式。

谷歌计划将这项技术能力逐步推广至面向普通用户的产品中。未来,该功能将推送至Gemini应用全部Flash、Flash‑Lite模型用户。智能体视频理解还将赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型输出更贴合视频画面内容的问答结果,为用户带来更加智能的视频观看体验。

OpenAI奥尔特曼:人形机器人将至,先投工业领域再进普通家庭
"OpenAI今年已创立机器人部门,招聘信息显示,公司正在定制机电执行器、仿真流程和机器人数据采集等具身智能领域展开探索。他同时强调,并非所有机器人都需要是人形,当人形结构无法带来实际优势时,OpenAI会针…

2026-09-03

马斯克预测:2036年全球人形机器人将超10亿台,AI或促经济大幅增长
联合国此前预测,到2037年全球人口会达到约90亿,按此估算,届时相当于平均每9人就拥有一台人形机器人。马斯克称,十亿台人形机器人的生产力将超过所有人类生产力的总和。(剪辑 匡萍) 责编:曾梓民 一审:匡萍…

2026-09-03

Homer AI好马亮相福祉博览会,以VLX端侧模型助力视障群体开启全场景智能生活
依托自研 VLX 模型基座,Homer AI好马构建了强大的 AI 可穿戴视觉中枢,并以中枢为核心,打造了 Homer AI 好马助视眼镜等产品,让可穿戴设备获得“感知·理解·决策·行动”的能力。Homer…

2026-09-03

谷歌为Gemini模型增智能体视频理解功能,降成本提效率助力视频处理新突破
后续该功能将推送至Gemini应用全部Flash、Flash‑Lite模型用户;未来数月,智能体视频理解还将赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型,输出更贴合视频画面…

2026-09-03

从“专用”到“通用”:本末科技探索机器人模块化开发新路径
模块化提供了一条可探索的路径:将部分能力封装为可组合、可替换的模块,让新需求尽可能通过模块调整来满足,减少对整机重新开发的依赖。第一层,是外设模块化,更换夹爪、传感器和作业工具;第二层是功能模块化,对机械臂…

2026-09-03