MopMonk Agent闯入OpenAI、Anthropic安全榜单,疑为中国团队
哪家中国公司这么强悍?杀进了 OpenAI、Anthropic 的安全榜单
近日,一个名为 MopMonk Agent 的新面孔,突然出现在 CyberGym 榜单上。
MopMonk Agent 在 CyberGym Level 1 中取得 73.1% 成功率,排名第 7,基座模型为 MiniMax M3。
相比榜单上 OpenAI、Anthropic、微软等一线玩家,MopMonk 没有公开背景信息。
CyberGym 是 UC Berkeley 团队推出的网络安全 Agent 评测框架,核心不是让模型“判断哪里可能有漏洞”,而是要求 Agent 在给定漏洞描述和未修复代码库后,生成能够真实触发漏洞的 PoC 输入,并通过修复前、修复后两个版本验证结果。
这也是 CyberGym 难度所在。
CyberGym 覆盖 1507 个真实漏洞实例,来自 188 个大型软件项目。很多任务需要 Agent 跨越数千个文件、数百万行代码,理解漏洞线索、代码路径、输入格式,再根据执行反馈不断调整测试输入。
MopMonk Agent 的核心路线并不是单纯堆模型参数,而是“memory-centric Multi-Agent design”,也就是以结构化记忆为中心的多 Agent 设计。系统会持续整理代码观察、失败尝试、候选输入和验证反馈,将它们沉淀为可复用的漏洞记忆,避免每一轮探索都重新开始。
简单说,MopMonk Agent 试图解决的是漏洞挖掘中最消耗时间的问题「反复读代码、反复试错、反复撞同一堵墙」。
MopMonk Agent 会记录哪些路径走不通,哪些输入格式不成立,哪些候选 PoC 接近触发条件,下一轮尝试必须避开什么失败原因。
这套设计和 MiniMax M3 的组合,是这次成绩最值得关注的地方。
MopMonk 选择 MiniMax M3 是因为其长上下文、MoE 架构、稀疏注意力、代码能力和长周期 Agent 任务中的稳定性。
MiniMax M3 提供底座能力,MopMonk 的结构化记忆和多 Agent 探索机制,负责将这种能力转化为漏洞复现效率。
在 CyberGym 榜单上,MopMonk Agent 前面依次是 Crystalline、微软 MDASH、OpenAI Agent、Anthropic Agent 等系统。
MopMonk 的特殊之处在于,没有披露完整团队信息,却直接进入了高位区间。
这让 MopMonk 多了一层悬念。
“MopMonk”翻译为中文即为“扫地僧”,而且模型为 MiniMax M3,外界自然会猜测它是否来自中国团队,甚至是否与某个安全公司或 AI 团队有关。
但截至目前,公开页面只确认了代号、基座模型、技术路线和榜单成绩,没有给出更多组织身份信息。
CyberGym 真正拉高门槛的地方,是将 AI 安全评测放进真实代码库。Agent 不仅要理解漏洞,还要完成输入构造、运行验证和多轮修正。
MopMonk Agent 的出现,说明 AI 安全赛道可能正在形成第三条路线:
1)OpenAI、Anthropic 代表的强模型路线;
2)微软 MDASH 代表的系统工程路线;
3)更垂直的安全 Agent 路线。
如果说过去 AI 安全榜单主要看模型能力,这里 MopMonk 提供了另一个观察角度,真正能完成任务的系统,往往是模型、记忆、工具和验证流程共同作用的结果。
参考链接:
https://www.cybergym.io/cybergym/
https://github.com/MopMonkAI/MopMonkAgent
云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。
查看原文 →
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力