跳到主内容
@wquguru
精选88meng shao技巧与观点多源精选 ×4

TypeSafe CEO Diogo:ChatGPT让行业丢失其他模型形态

InstructGPT 的共同作者、RLHF 的主要参与者,如今却认为:ChatGPT 的成功让全行业“丢掉了所有其他模型形态”,只剩自回归聊天这一条路!

原文
发到 X
推荐理由

深度访谈揭示了RLHF之外的新范式RLCD与System One模型理念,对Agent架构设计和模型选型有极高参考价值,建议关注其方法论。

InstructGPT 的共同作者、RLHF 的主要参与者,如今却认为:ChatGPT 的成功让全行业“丢掉了所有其他模型形态”,只剩自回归聊天这一条路!

TypeSafe CEO @CompleteSkeptic 参加 @latentspacepod 播客,与 @swyx 进行了 140 多分钟深度讨论,讲述了他为什么离开 OpenAI 创立 TypeSafe AI,推出不聊天、不写文本、专为代码消费而生的 “System One 模型” Jev,用新训练范式 RLCD 追求“intelligence per dollar”,直指当前 AI 最刺眼的悖论:模型能解千禧年数学难题,却自动化不了最普通的日常工作! https://www.youtube.com/watch?v=cFx9Z3ZXca0

System One Model: 让代码成为消费者 借 Kahneman 的双系统框架,Jev 定位为 System 1 模型:不生成文本、不写代码、不对话,快速给出嵌入程序流的、带校准概率的小型判断,他称之为“聪明的 if 语句”。官方文档明确:Jev 不做 Claude Code / Cursor 背后 LLM 的替代品,是要承担智能体和软件内部的结构化决策。

RLCD: 第三个北极星 RLCD (Reinforcement Learning for Calibrated Decisions,校准决策强化学习) 是未发表的核心方法。关键不是算法是目标函数,RLHF 的北极星是“指令遵循”,RLVR 是“可验证难题”,RLCD 是“program in the loop”:在 System One 任务上给出认识论上诚实的概率。校准意味着预测 0.8 的事件真的在约 80% 的情况下发生,概率由此变成软件可调用的接口,可设阈值、可决定何时升级人工。

Diogo 对 RLHF 的批判相当技术化:偏好优化导致模式坍缩 (如同 GAN 丢弃少数模式、日趋保守),且“校准对字符串的概率分布是彻底的毒药”,这就是文本模型做不好决策的原因。有趣的是,他以此回应 LeCun 的 “LLM 必然因误差累积而失败” 论:“数学上显然,但经验上不成立”,因为保守化、坍缩后的模型恰恰避开了理论预测的误差累积。RLVR 则 “加剧了参差智能”,解题更强却更难嵌入其他软件。

两个昂贵的反共识决策 · 拒绝公开基准:“极易被博弈”;当年“每个实验室都有团队在收集长得像 MMLU 的数据”,那只是“带额外步骤的基准测试”。替代方案是“凭氛围与信任,直到放进真实工作流里评估”。内部 eval 则把“不自欺”当作最高优先级。这个立场曾让融资处处碰壁,他拒绝妥协:“奖励坏演员的事我不干。” · API 层不做拒绝:拒绝在消费级聊天里合理,但对软件依赖是类型错误。他区分“安全对齐”(听实验室的话)与“能力对齐”(听用户的话),并直言前者“是指令遵循的反面”。类比数据库:智能不应审查自己的使用方式;在技术层“把拇指压上秤会割裂智能”,每一次强制过拟合都在侵蚀通用性。

数据实验室,不是模型实验室:10 亿美元也不预训练 “你优化什么,就得到什么,而且最重要的部分根本不是 ML。”他视 scaling laws 为“指数级资源换次线性收益”的坏投资,除非收益极其宝贵。TypeSafe 自我定位为 data lab 而非 model lab,数据全部合成,由“有品味的人”像艺术家一样找到认知核心的参差点并“手术式”修补,他正在“无限量招聘数据人才”。为留在 intelligence/$ 的帕累托前沿,他们“做尽恶心的事”,自称“模型的弗兰肯斯坦”。模型命名 Jev 正是 Jevons 悖论:智能越便宜,总消耗反而越大,他的赌注是廉价智能将引发软件业的“淘金热”,重回“早期互联网的能量”。

对软件与编码智能体的意义 · 方法论:把工作流拆解为大量“小而可测的决策”,每个失败变成永久的测试用例,“软件不会像 prompt 那样因上下文腐烂而遗忘”。他称之为 "ML without the ML"。 · Inverse SaaS-pocalypse: AI 将“像 regex 一样不起眼地”消失进软件内部,成为每个程序员可调用的语义判断原语。 · 编码智能体:他后续发表 "Tyranny of the KV Cache" 一文,主张 "Cache Rules Everything",上下文缓存经济决定智能体架构 (压缩工具调用、共享状态、sub-agents),并在单一模型架构上展望多智能体未来。 · 落地用例:意图路由、置信度分流、rubric 评分、实体消解(暗数据)、代码 lint、分析回放,甚至有人在 Jev 之上构建编程语言(他最爱的用例)。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →