精选70Hugging Face 每日论文(json_list)论文研究
FoldingAgent:基于演示视频推理折纸程序的智能体框架
FoldingAgent: Inferring Parametric Origami Procedures from Demonstration Videos
我们提出了 FoldingAgent,这是一个智能体框架,可以直接从折纸演示视频中推断出显式的参数化折叠程序。我们的框架利用预训练视觉-语言模型(VLM)的推理能力,并配备了一套专用工具,使智能体能够模拟几何变换、验证物理合理性、检索和比较视觉内容,以及评估自身的预测结果。为了将视觉内容转化为折叠程序,我们定义了一个由纸张几何形状和一组参数化折叠动作组成的参数空间。与预测静态折痕图案的模型不同,我们的智能体按顺序操作,并具有重新规划其动作的能力,从而有效缓解了多步折叠中固有的累积误差。我们的方法在弥合人类折纸知识(主要通过非结构化的视觉演示共享)与计算方法(通常依赖于结构化、参数化的表示,如折痕图案或可执行的参数化计划)之间的差距方面迈出了重要一步。我们在 PurelandFold 上评估了我们的方法,这是一个新整理的包含多种 Pureland 折纸视频的基准数据集,具有真实几何形状和动作标签。我们的结果表明,通过结合 VLM 推理、一套专用工具和物理仿真,我们可以成功地将非结构化的视觉演示转化为可执行的、符合物理规律的折叠程序。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力