跳到主内容
@wquguru
精选88Hugging Face 每日论文(json_list)论文研究

CogEvol:面向学习环境的单步生成模型与工程实践

CogEvol: Towards Efficient and Reliable Learning Environment Generation

原文
发到 X
推荐理由

不仅提出了新模型,更完整披露了从失败数据清洗到 RLHF 防作弊的工程闭环,对 Agent 落地极具参考价值。

我们推出 CogEvol,这是一系列专为学习环境生成(Learning Environment Generation)训练的模型:将课程大纲一次性转化为成品学习素材(结构化 JSON 幻灯片或自包含的交互式 HTML 页面)。在 22 万条生产请求中,CogEvol 生成幻灯片的中间耗时为 17 秒,生成交互式页面的中间耗时为 59 秒,取代了以往需要多轮代理编排、耗时数分钟的工作流程。可靠性并非依赖运气,而是通过工程手段保障:基于生产环境的数据管道将真实失败案例转化为 53,687 个经过验证的监督微调(SFT)样本;结合规则与视觉语言模型(VLM)的混合奖励机制驱动基于 GRPO 的强化学习(RL),并在我们发现并修复了一起产生视觉上逼真但无法游玩的游戏的奖励作弊事件后进一步加固。CogEvol-27B 在幻灯片质量上得分 83.7,在包含 500 个案例的交互式 HTML 基准测试中得分 63.7,其参数量仅为旗舰级代码模型的 1/26.9,并与 OpenMAIC 团队合作,为其处理实时生产流量。CogEvol-4B 以 Apache 2.0 许可证开源发布,地址为 https://github.com/CogEvol/CogEvol-4B;其他外部旗舰模型也在相同的评估套件和完全一致的测试框架下进行对比。脚手架编辑功能进一步将交互式页面生成成本降低约 76%,且整个技术栈可在国产昇腾(Ascend)加速器上运行,在应用层性能上与 A800 GPU 持平,从而降低了规模化 AI 原生教育的单位成本。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近