跳到主内容
精选88meng shao模型发布/更新

Google Gemini 推出 Agentic Video

Google 为 Gemini 推出 Agentic Video Understanding

原文
推荐理由

Gemini 在视频理解上的架构级升级,大幅降低成本并提升精度,做多模态应用的同学值得重点关注其性能表现。

Google 为 Gemini 推出 Agentic Video Understanding

Gemini 系列在多模态理解上还是最强之一,这次 AVU 首发于 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite: · Token 消耗降低最高 88% · 分析成本降低最高 66% · 准确率反而提升最高 7%

https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini

技术本质:从"被动看"到"主动查" 传统视频处理是静态模式:模型以固定帧率(默认 1 FPS)均匀 ingest 整个视频,不管内容重要与否。这导致一个两难: · 帧率低 → 漏掉关键瞬间(快速动作、切换边界) · 帧率高 → 长视频 token 成本爆炸

Agentic 模式让模型进入 agentic loop:模型自主决定看哪里、用什么速度、走哪个模态(画面帧 / 音频 / 字幕转录),通过调用内部工具按需加载视频的特定片段。这是把此前已在图像领域推出的 agentic vision(代码执行 + 视觉理解)思路延伸到了视频的时间维度上。

四项关键能力 1. 亚秒级时刻定位——捕捉 1 FPS 下必然丢失的瞬间状态变化和剪辑边界,支撑自动化精剪 2. 长视频大海捞针——数小时视频中回答复杂问题,token 消耗从百万级大幅压缩 3. 异常检测——对可疑时间窗口动态提高采样率,检查快速运动和细微视觉瑕疵 4. 动作与物体计数——通过变速反复回看,准确统计重复动作

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近