跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

Sci-VBench:科学领域视频生成评测基准

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

原文
发到 X

我们介绍了Sci-VBench,这是一个用于评估科学领域知识和推理密集型视频生成的综合基准。它包含1,253个专家标注的示例,涵盖四个核心学科的60个主题:自然科学、医疗保健、人文与社会科学以及工程学。每个示例要求模型生成时间上丰富的视频,这些视频需要科学推理和基于知识的综合,超越表面视觉合理性。我们进一步建立了一个基于评分标准的评估协议。我们的分析表明,在该协议下,非专家人类评估者和MLLM-as-Judge系统都能与专家判断达到较高的一致性,支持大规模可复现的评估。我们对16个前沿专有和开源模型进行了基准测试,发现虽然自动感知质量分数在各系统间紧密聚集,但在提示接地和科学及因果正确性方面的表现差异显著,且专有与开源模型之间存在明显差距。这些发现表明,视觉真实性的进步尚未转化为对科学和因果动态的可靠建模。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近