跳到主内容
@wquguru
精选88AYiAI 产品与模型

开源 AI 包工头 Raven 0.2.0:调度多模型完成全栈开发

卧槽这个刚开源的 AI 包工头 Raven 0.2.0真的有点屌炸,从需求提出到交出、宣发海报、商业路演 PPT 与上线官网,曾经需要消耗一个数十人团队数月周期…

原文
发到 X
推荐理由

结构清晰拆解了复杂框架的核心机制,用具体案例和实操步骤展示了产品价值,写法值得参考。

卧槽这个刚开源的 AI 包工头 Raven 0.2.0真的有点屌炸,从需求提出到交出、宣发海报、商业路演 PPT 与上线官网,曾经需要消耗一个数十人团队数月周期的生产成本,刚刚被开源代码压缩成了一个自然人和 4 天的算力。

兄弟们敢相信,一个可玩的 3D 游戏需求,它自己连干 4 天,宣发海报、商业路演 PPT 与上线官网全给你做出来,

它不跟 Claude Code Codex 抢活,直接把这些你已经付费的 AI 全收了当员工, 自带任务图和共享记忆,跑几天都不崩,

最狠的是它还会自己改自己的工作流程,能递归自我改进,相当于一个会自己变强的虚拟 AI 公司,真的太牛逼了, 我跟大家大白话拆解清楚,

1|它到底是啥?

先说 harness, 可以理解成 AI 的“工作手册 + 工具箱”: 怎么看资料、怎么拆任务、能用哪些工具、做完怎么自查。

Claude Code 有一套,Codex 也有一套, 问题是,没有哪套手册什么都擅长, 写代码的那套做不好调研,做调研的那套排不好版。

Raven 管自己叫 harness of harnesses, 翻成人话就是 它不是又一个干活的 AI, 是带一群 AI 的包工头。

2|它手下有谁?

自带 4 个工种: Research:深度调研,出带出处的报告 Code:把需求写成能跑、测过的代码 Design:做 PPT、图表、品牌物料和网页界面 Oncall:值夜班,跑实验、盯流程,需要人拍板时才叫你

还预置了 13 个第三方 Agent: Claude Code、Codex、Kimi Code、Qwen Code、GitHub Copilot……

你已经付费的 Agent 不用换, 直接变成它的员工。

有它不会的技能, 它会去一个 11 万+ 的技能库里现找。

3|为什么能连干几天不崩?

普通 Agent 干长活,一般就两种死法: 上下文爆了,忘了前面干过啥; 中间错一步,后面全跟着错。

Raven 的解法: 先把大任务拆成任务图,谁先谁后、哪些能并行,排得清清楚楚; 所有子 Agent 共用一套长期记忆(EverOS),跨会话也记得你的偏好和之前踩过的坑; 游戏那个案例,就是 42 轮“规划→开发→验证”滚出来的。

就像一个真正的项目组: 有排期表,有共享文档,有测试。

4|最反直觉的:AI 自己改自己的 SOP

以前优化 Agent: 人看日志 → 人改提示词 → 人再跑一遍。

Raven 里有个 Curator, 把 Agent 拆成 4 个位置: →看什么(Memory) →怎么规划(Planning) →能用什么工具(Capability) →下一步做啥、动手前怎么判断(Action)

然后一轮一轮地改。 改的不只是提示词, 工具、技能,甚至判断逻辑的代码都能换。

有两道保险: 改动先验证,过了才装上,没过就打回去重做; 在 RSI 实验里,评分标准它自己改不了。

好比学生能自己改学习方法,但改不了考卷, 这就是它说的 RSI:递归自我改进。

5|仓库里的 3 个硬核案例(项目方自己公布)

🎮 Godot 4 第一人称射击游戏:自主运行约 4 天,迭代 42 轮,游戏、海报、PPT、网站全包 🧪 nanochat 预训练:7 轮跑了 172 次训练,一次没崩;同样是单卡 20 分钟的预算,核心损失指标又降了 5.8% 🌊 溃坝流体模拟:越界误差降了 3 个数量级;有限元极限载荷搜索,8 轮二分就收敛了

这些成绩没有第三方复现, 但游戏、网站、PPT 都公开放在仓库里,你可以自己点进去看。

6|怎么上手

① 安装:最骚的一步是把官方给的安装提示词丢给 Claude Code 或 Codex,让你的 AI 帮你装 AI 也可以只装 Git + Docker,用容器跑起来,浏览器打开 localhost:18793

② 接入:把你手上的 Claude Code、Codex 挂进来

③ 派活:别只说“帮我做个 XX”,要写清楚:目标 + 限制条件 + 验收标准 验收标准越硬,它越能自己迭代

④ 盯进度:在网页界面里看任务进度、文件、产出、记忆和技能

⑤ 定制:用一段话描述你想要的助手,Curator 会组一个“主理人 + 专家组”,下次一句话就能开工

7|谁最该试?

独立开发者:Research 调研竞品 → Code 写 MVP → Design 做落地页和路演 PPT,一条链跑完

科研党:把跑参数、调参、看曲线、写报告丢给 Oncall, 睡一觉起来看结果

团队负责人:把团队天天重复的流程做成专属助手,越用越顺

8|照例泼盆冷水 官方自己写了:pre-alpha,接口和配置随时会变 Curator 自我改进还是实验功能,跟着源码仓库走,不在安装包里 连跑几天就是一直在烧 token,先设好预算上限 给 Agent 执行命令的权限之前,先把它关进 Docker 或测试环境,别拿它直接碰线上正式环境。

看完这个项目,最大的感受是以前拼的是哪个模型更聪明,接下来拼的是:谁能把一群 AI 组织起来, 还让这个组织自己变强。

说白了,AI 再强,也只是一个员工, Raven 想做的,是一家会自我迭代的公司。

开源,Apache 2.0, 我亲爱的铁汁们最想先让它接手哪件事呢:调研、写代码,还是值夜班?

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

关联信息,但可能不是同一事件