跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

DeepSeek Harness 间接提示注入评估:最高成功率 25.5%

Security Assessment of DeepSeek Harness with A.I.G: Evaluating Resistance to Indirect Prompt Injection

原文
发到 X

我们在DeepSeek Harness(DSH)中评估间接提示注入,使用AI-Infra-Guard(A.I.G)构建测试、传递受控污染、执行DSH、收集轨迹并判定结果。该研究涵盖14,560次受控执行,涉及16个间接内容渠道、文本和文件载体模式、35个载荷目标、一个未修改的基线以及12种攻击方法。实验保留了DSH的代理循环、工具注册表、模型适配器和会话事件路径;源工具和敏感汇点为本地夹具,因此尝试的操作会被记录而不会产生外部副作用。我们使用确定性基于规则的评判器(RuleJudge)和基于语义的LLM评判器(LLMJudge)评估每条轨迹。观察到的最强攻击成功率分别为:文本模式下伪造完成攻击为17.0%,文件模式下隐藏Unicode为25.5%,文件模式下技能渠道为16.0%。此外,LLMJudge比RuleJudge更频繁地判定部分合规(7.3%对比2.0%)。我们将这些结果与DSH对工具结果、附加上下文和工具调用策略钩子的处理相关联,然后识别应置于不受信任内容与敏感操作之间的控制措施。我们的代码可在https://github.com/Tencent/AI-Infra-Guard/tree/main/Research/deepseek-harness-security-assessment 获取。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近