跳到主内容
@wquguru
精选85Hugging Face 每日论文(json_list)论文研究

AnTrap:首个评估安卓GUI智能体运行时异常鲁棒性的基准

Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments

原文
发到 X

图形用户界面代理在部署到安卓设备上时,常会遇到动态异常,从意外弹窗到操作误用,然而现有基准缺乏对代理在运行时异常下鲁棒性的系统性评估。我们引入了AnTrap,一个全面的基准,通过向代理执行轨迹注入动态扰动来评估其性能。我们提出了一种分类法,将现实世界中的异常组织为四个层面(状态、思考、动作和回合),涵盖十个细粒度子类别,并开发了一个构建流程,在引入现实对抗条件的同时保持任务可解性。评估16个领先的图形用户界面模型后,我们揭示了它们对动态异常的普遍脆弱性,即便是最强的模型也遭受显著的性能下降。此外,我们在原始和对抗环境中进行了GRPO训练以验证我们的基准,将环境可学习的异常与推理瓶颈型异常区分开来。我们的发现表明,虽然状态和动作层面的单步陷阱大多可通过对抗强化学习解决,但深层上下文陷阱,如状态死锁,暴露了内在局限性,仅通过在含陷阱的环境中训练无法解决。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近