精选85Google DeepMind 博客(RSS)产品发布/更新
Gemini 推出 Agentic 视频理解能力
Introducing agentic video understanding with Gemini
推荐理由
Gemini 新增的 Agentic 视频理解能力实现了从被动观看到主动交互的跨越,对处理长视频复杂任务的开发者和用户有直接实用价值,值得关注其实际效果。
Google DeepMind 在官方博客宣布,Gemini 模型现已具备 Agentic 视频理解能力。该功能允许模型主动与视频内容进行交互,而非仅被动观看。用户可通过自然语言指令,让 Gemini 执行复杂的视频分析任务,例如定位特定事件、追踪物体轨迹或回答关于视频情节的细节问题。这一更新标志着多模态大模型从内容识别向主动推理与交互的演进,旨在提升长视频场景下的信息提取效率与准确性。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力