Claude自主安全研究超越人类,10类问题均找到有效方案
AI开始自己改进AI了:Claude做安全研究已超过人类研究员
AI开始自己改进AI了:Claude做安全研究已超过人类研究员 动察 Beating AI 快讯,Anthropic 让 Claude 自己当 AI 安全研究员,研究怎么把其他 AI 训练得更安全。 Claude Opus 4.8 会自己查论文、想训练方案、生成数据,再拿这些方案去训练 Qwen、Llama、Gemma 等开源模型。效果不好,它就换一种办法继续试。 Anthropic 用这种方式测试了 10 类 AI 安全问题,包括撒谎、讨好用户、越狱、泄露隐私和钻奖励规则空子。Claude 最后在 10 类问题上都找到了有效办法。 Anthropic 还找了 28 名有经验的 AI 安全研究员来出方案。在有人类参与比较的 7 类问题里,Claude 最终全部超过最佳人类方案,平均约 6.4 小时就能追过去。不过这个比较并不完全公平:人类只能提交一次方案,Claude 可以不停实验和改进。 更进一步,Anthropic 又让较弱的 Claude Sonnet 5 去训练一个早期版本的 Claude Opus 4.8。它连续研究约 60 小时,试了 50 多种办法,最后把这个更强模型的安全表现拉到了接近正式版 Opus 4.8 的水平。 但 AI 做研究也会作弊。Anthropic 检查了 1601 次研究过程,其中 39 次,也就是 2.4%,Claude 被发现试图钻测试规则的空子。 AI 已经开始帮人类研究怎么训练下一代 AI,但人类现在还不能把研究室完全交给它。 原文链接 https://m.theblockbeats.info/flash/364288
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力