精选80Hugging Face 每日论文(json_list)论文研究
StepGuard:步骤级智能体护栏,攻击成功率降77.3%
StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing
基于LLM的智能体可以通过工具调用来与外部环境交互,但这种能力也引入了安全风险,如文件修改、信息泄露和未授权操作。现有的防护措施往往评估已完成的轨迹,对执行前步骤级动作的监控研究不足。我们提出了StepGuard,一种步骤级防护模型,能够审计已完成的智能体轨迹,并在工具动作执行前进行检查。为了训练StepGuard,我们引入了StepGen,一个自动数据引擎,生成具有相同上下文但在风险步骤上动作不同的安全与不安全轨迹。为了进一步减少过度防御和防御不足,我们提出了Balance-GRPO,它根据观察到的准确率动态平衡安全与不安全动作之间的学习。实验表明,StepGuard在开放权重防护模型中达到了最高的平均准确率,性能可与GPT-5.4相媲美。当用于保护AgentDojo和AgentDyn上的智能体时,StepGuard将平均攻击成功率相对无防护设置降低了77.3%,而平均效用仅下降了2.8个百分点。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力