跳到主内容
@wquguru
精选80云头条行业动态

Claude Opus 5系统提示词泄露,含安全路由机制

Opus 5 被扒!2000 行「系统提示词」曝光,长达 20 万字符!

原文
发到 X

2026 年 7 月 25 日,知名 AI 越狱研究者 Pliny the Liberator 发布消息,称已提取并公开 Claude Opus 5 的完整系统提示词。

相关文件被上传至其维护的 GitHub 项目 CL4R1T4S,内容接近 20 万字符,涉及 Claude 的产品信息、安全规则、记忆机制、联网搜索、版权限制以及模型路由策略等大量内部指令。

公开文件共有约 2000 行,GitHub 页面显示其大小约为 198 KB。

文件开头将当前模型标记为 Claude Opus 5,并列出了 Claude Fable 5、Claude Sonnet 5、Claude Haiku 4.5 等产品,同时提到更高一级的 Mythos 模型及 Anthropic 的 Project Glasswing 项目。

其中最受关注的是名为“fable_safeguards_routing”的指令模块。

该部分显示,当用户选择 Claude Fable 5 后,部分涉及网络安全、生物学或其他高风险领域的请求,可能不会继续交给 Fable 5 处理,而是自动转交给能力相对较低的 Opus 系列模型。

这项机制并非完全来自泄露文件。

Anthropic 官网已经公开说明,Fable 5 的部分网络安全请求会自动转交给 Opus 4.8,部分生物学请求则会转交给 Opus 5。Anthropic 称,这种设计旨在降低高能力模型被滥用的风险。

不过,疑似泄露的提示词披露了更详细的模型应答规则。

例如,当用户询问为何选择 Fable 5 却收到 Opus 5 的回答时,系统要求 Claude 向用户解释安全路由机制,并说明部分请求可能被发送给“下一档能力最强”的模型处理。

文件还显示,Claude Opus 5 的可靠知识截止时间被设定为 2026 年 5 月底。

对于新闻、现任职位、法律政策、产品版本、价格和其他可能变化的信息,模型被要求主动进行网络搜索,而不是依靠训练数据直接回答。

在政治内容方面,系统提示词要求 Claude 可以解释或代写不同政治、伦理和政策立场,但应将其表述为相关立场支持者的主张,而不是 Claude 自身的观点;对于争议性议题,还应补充反方观点或现实中的证据争议。

版权规则同样占据较大篇幅。

文件将版权合规列为仅次于安全规则的高优先级要求,并禁止模型逐段复制文章、诗歌和歌词等受保护内容。即使用户要求的内容很短,也不能因此绕过相关限制。

此外,该文件包含 Claude 的记忆管理、用户偏好保存、文件创建、联网搜索、图像搜索、位置调用以及工具使用规范。系统要求模型在处理复杂研究任务时增加搜索次数,并对快速变化的信息进行多源核实。

Pliny 将这份文件称为 Claude Opus 5 的“完整系统提示词”,并特别强调其体量庞大以及新增的 Fable 5 安全路由模块。其 CL4R1T4S 项目长期收集来自 OpenAI、Anthropic、Google、xAI 等公司的疑似系统提示词,目前已获得超过 4.6 万个 GitHub Star。

不过,目前没有证据可以独立确认 GitHub 文件是否完整对应 Anthropic 线上产品的真实系统提示词。

此类内容通常通过提示注入、模型输出拼接或反复探测获得,可能混入模型生成内容、旧版本规则或特定客户端的附加指令。

但文件中的部分产品信息和路由规则,与 Anthropic 官网已经公布的 Opus 5、Fable 5、Mythos 5及 Project Glasswing 信息基本一致。

Anthropic 于 7 月 24 日正式发布 Claude Opus 5,并将其定位为面向长期智能体任务、编程和专业工作的旗舰模型。

链接:

https://github.com/elder-plinius/CL4R1T4S/blob/main/ANTHROPIC/OPUS-5.md

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

查看原文 →

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近