精选75Hugging Face 每日论文(json_list)论文研究
将Agent轨迹压缩为有限状态机,实现失败预测与运行时监控
Automata from Agent Traces: Failure and Next-Step Prediction
基于LLM的智能体执行多步骤任务,但其行为结构仍不透明:冗长无结构的轨迹难以满足部署所需的安全审计和运行时监控。现有方法要么按单次轨迹操作,要么仅关注成功案例,因此遗漏了连接下一步预测与失败预测的跨运行拓扑结构。为恢复这一共享结构,我们将整个轨迹语料库压缩成一个紧凑的有限状态机(FSM),作为LLM智能体原本不可预测行为的结构基底。在十二个公开数据集上,这些FSM紧凑(7-43个状态),以>=0.997的适应度重放保留数据,各分割间拓扑几乎一致,且构建时间仅为毫秒级。该基底同时服务于两个预测目标。对于下一步预测,FSM状态上下文在所有与真实标签匹配的数据集上均优于Agent Workflow Memory。对于失败预测,基于状态的每状态行为特征在保留数据上达到最高0.94的AUROC,且在线监控器可从部分轨迹中将失败运行排在成功运行之前,在完成前提前触发早期停止。因此,行为拓扑似乎更多由部署框架而非LLM塑造,为安全审计和运行时监控提供了与模型无关的结构原语。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力