跳到主内容
@wquguru
精选65云头条研究与分析

MopMonk Agent闯入OpenAI、Anthropic安全榜单,疑为中国团队

哪家中国公司这么强悍?杀进了 OpenAI、Anthropic 的安全榜单

原文
发到 X

近日,一个名为 MopMonk Agent 的新面孔,突然出现在 CyberGym 榜单上。

MopMonk Agent 在 CyberGym Level 1 中取得 73.1% 成功率,排名第 7,基座模型为 MiniMax M3。

相比榜单上 OpenAI、Anthropic、微软等一线玩家,MopMonk 没有公开背景信息。

CyberGym 是 UC Berkeley 团队推出的网络安全 Agent 评测框架,核心不是让模型“判断哪里可能有漏洞”,而是要求 Agent 在给定漏洞描述和未修复代码库后,生成能够真实触发漏洞的 PoC 输入,并通过修复前、修复后两个版本验证结果。

这也是 CyberGym 难度所在。

CyberGym 覆盖 1507 个真实漏洞实例,来自 188 个大型软件项目。很多任务需要 Agent 跨越数千个文件、数百万行代码,理解漏洞线索、代码路径、输入格式,再根据执行反馈不断调整测试输入。

MopMonk Agent 的核心路线并不是单纯堆模型参数,而是“memory-centric Multi-Agent design”,也就是以结构化记忆为中心的多 Agent 设计。系统会持续整理代码观察、失败尝试、候选输入和验证反馈,将它们沉淀为可复用的漏洞记忆,避免每一轮探索都重新开始。

简单说,MopMonk Agent 试图解决的是漏洞挖掘中最消耗时间的问题「反复读代码、反复试错、反复撞同一堵墙」。

MopMonk Agent 会记录哪些路径走不通,哪些输入格式不成立,哪些候选 PoC 接近触发条件,下一轮尝试必须避开什么失败原因。

这套设计和 MiniMax M3 的组合,是这次成绩最值得关注的地方。

MopMonk 选择 MiniMax M3 是因为其长上下文、MoE 架构、稀疏注意力、代码能力和长周期 Agent 任务中的稳定性。

MiniMax M3 提供底座能力,MopMonk 的结构化记忆和多 Agent 探索机制,负责将这种能力转化为漏洞复现效率。

在 CyberGym 榜单上,MopMonk Agent 前面依次是 Crystalline、微软 MDASH、OpenAI Agent、Anthropic Agent 等系统。

MopMonk 的特殊之处在于,没有披露完整团队信息,却直接进入了高位区间。

这让 MopMonk 多了一层悬念。

“MopMonk”翻译为中文即为“扫地僧”,而且模型为 MiniMax M3,外界自然会猜测它是否来自中国团队,甚至是否与某个安全公司或 AI 团队有关。

但截至目前,公开页面只确认了代号、基座模型、技术路线和榜单成绩,没有给出更多组织身份信息。

CyberGym 真正拉高门槛的地方,是将 AI 安全评测放进真实代码库。Agent 不仅要理解漏洞,还要完成输入构造、运行验证和多轮修正。

MopMonk Agent 的出现,说明 AI 安全赛道可能正在形成第三条路线:

1)OpenAI、Anthropic 代表的强模型路线;

2)微软 MDASH 代表的系统工程路线;

3)更垂直的安全 Agent 路线。

如果说过去 AI 安全榜单主要看模型能力,这里 MopMonk 提供了另一个观察角度,真正能完成任务的系统,往往是模型、记忆、工具和验证流程共同作用的结果。

参考链接:

https://www.cybergym.io/cybergym/

https://github.com/MopMonkAI/MopMonkAgent

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

查看原文 →

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近