跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

VideoGAIA:面向通用AI助手的智能体视频理解基准

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

原文
发到 X

视频理解是评估多模态大语言模型(MLLMs)能力的一项基础任务。然而,现有的领先模型在Video-MME排行榜上已实现约90%的准确率,这表明传统的单轮视频理解任务正日益饱和,不足以评估先进MLLMs的智能水平。为此,我们引入了VideoGAIA,一个面向通用人工智能(AI)助手的代理式视频理解基准。VideoGAIA超越了单次视频问答,将视频理解构建为多轮、工具增强的交互过程,其中模型必须迭代地感知视频、调用外部工具、收集补充信息,并在各轮次间整合多模态证据。VideoGAIA包含271个由模型与人类共同设计的任务,覆盖多样且复杂的现实场景。每个视频-问题-答案实例均由三位人类专家独立验证,以确保正确性和适当的难度。所有被评估的MLLMs,包括GPT-5.5和Kimi-K3等前沿模型,在VideoGAIA上的准确率均低于60%,这凸显了其作为评估下一代MLLMs的高质量、及时基准的价值。我们希望VideoGAIA能促进从传统视频理解向代理式视频理解的转变。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近