精选75Hugging Face 每日论文(json_list)论文研究
ToolHazard:规模化生成对抗环境评估LLM智能体安全
ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents
集成外部工具的大型语言模型(LLM)智能体容易受到嵌入环境状态中的间接提示注入攻击。然而,现有研究大多依赖手动实现或复用的环境、基于随机LLM的工具模拟以及预定义的注入位置,限制了在更广泛领域内进行可扩展的安全研究。为弥补这一差距,我们提出了ToolHazard,一个可扩展的对抗性环境合成框架,该框架减少了人工工程,并支持通过额外的种子领域和计算资源进行扩展。通过环境模拟器、攻击者智能体和用户模拟器,ToolHazard合成了可执行的有状态环境,发现可行的注入点并生成针对特定环境的载荷,以及构建基于状态的长时程任务。基于ToolHazard,我们构建了ToolHazard-Bench,用于在复杂工作流和多样化环境攻击下对智能体进行压力测试。实验揭示了智能体的重大漏洞,并表明注入时机和位置会影响攻击效果。此外,ToolHazard生成的对齐数据在ToolHazard-Bench和AgentDojo上均提高了安全性,同时保持了良性任务的实用性。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力