跳到主内容
@wquguru
精选75律动 BlockBeats(Telegram)研究与分析

Anthropic训练AI审计AI:误报率97%,综合得分追平Opus

Anthropic训练AI查AI:不给正常案例,误报率直接冲到97%

原文
发到 X

Anthropic训练AI查AI:不给正常案例,误报率直接冲到97% 动察 Beating AI 快讯,Anthropic 研究人员尝试训练一种专门调查其他 AI 的 Agent。他们先给目标模型偷偷植入偏见、欺骗、伪造引用等隐藏行为,再让 Haiku 4.5 自己去查。Haiku 不知道答案,只能在最多 15 轮里换问题、改场景、反复测试。 训练时,研究人员也不会直接告诉 Haiku 抓对了没有。Haiku 每做完一次调查,系统就拿它和旧版 Haiku 留下的一份调查记录比较,再让提前知道答案的 Sonnet 4 判断哪一次查得更好。旧调查每 50 个训练步骤更新一次,相当于让 Haiku 不断挑战过去的自己。 但如果训练题里全是有问题的模型,Haiku 很快就会学歪。为了拿奖励,它开始默认所有模型都有问题,部分方案面对正常模型时,误报率接近 97%。后来研究人员把一半训练任务换成完全正常的模型,只有查完后正确判断目标模型没问题,才能拿到高奖励。 训练后的 Haiku 也确实开始换了一种查法。它会主动换场景、控制变量、比较前后回答,而不是一上来就逼模型认错。最终综合审计得分从 44.2 提高到 48.7,基本追平 Opus 4.6 的 48.4。换到更难、会主动隐藏异常行为的 AuditBench,检测率也从 11.5% 提高到最高 28.1%。 原文链接 https://m.theblockbeats.info/flash/363900

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近