精选70Hugging Face 每日论文(json_list)论文研究
SemComp-Bench:视频生成语义任务完成基准
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
我们引入了语义任务完成视频生成,这是一种面向结果的视频生成任务。在此框架下,成功既要求达成预期结果,也要求具备语义基础。语义基础描述了参考图像与生成结果之间在任务相关的高层语义上的对应关系。评估聚焦于生成的结果,既不需要呈现完整的中期任务步骤序列,也不要求与参考图像保持传统的外观一致性。为了支持系统性评估,我们构建了SemComp-Data,一个覆盖六个领域的评估数据集。每个实例包含一张参考图像、一条详细指令、一条简短指令以及一段以结果为中心的视频片段。一个可扩展的四阶段策展流程将原始视频转换为标准化的SemComp-Data实例。我们进一步引入了SemComp-Bench,一种评估协议,使用视觉语言模型(VLM)回答结构化的二元问题。SemComp-Bench分别报告OA分数和GR分数,用于衡量结果达成和生成可靠性。在代表性视频生成模型上的实验表明,在达成预期结果的同时保持参考图像中任务相关的语义基础仍然具有挑战性。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力