精选75Hugging Face 每日论文(json_list)论文研究
Second Thought:并行推理填补 Agent 行动等待期
Second Thought: Reasoning in Parallel as LLM Agents Act and Observe
在ReAct范式中,LLM代理在推理、行动和观察之间交替进行,但深思熟虑的推理仅限于思考阶段:当代理序列化一个动作并等待环境响应时,其推理是冻结的。我们识别出这一行动与观察的重复间隔为推理空闲窗口,并探究它是否能并行承载服务于未来轮次的额外推理。因此,我们提出“第二思考”(Second Thought),一个无需训练的推理框架,它在每个思考阶段结束的瞬间分叉出四个辅助分支,与主循环并发解码,并在环境观察到达时合并生成的思考。这样,第二思考将增加的推理移出主线程的顺序解码路径。在三个代理基准和三个推理LLM上,第二思考在所有九个(模型,基准)对中降低了平均轮次,并在其中六个设置中减少了主线程解码,最高达43%(这些设置中平均约20%),而在第七个设置中基本保持不变;Pass@1在九个对中的七个中无显著变化,两个显著差异为+12.4和+10.2个百分点。与一个计算匹配的对照组相比,该对照组将等效预算强制用于主线程自身的推理,在所有四个适用对照的设置中,第二思考以1.3到3.2的较少顺序解码获得了严格更高的Pass@1。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力