跳到主内容
@wquguru
精选88meng shao技巧与观点

Shopify ML团队详解:0.8B模型如何击败GPT-5.6-sol

Shopify ML 团队微调后的 0.8B 小模型,在一个高度专门化的任务上打败了 GPT-5.6-sol (xhigh) !

原文
发到 X
推荐理由

拆解了如何用0.8B小模型通过On-policy蒸馏击败大模型的完整工程闭环,参数取舍与分布对齐思路极具复用价值,做垂直领域落地的同学值得细读。

Shopify ML 团队微调后的 0.8B 小模型,在一个高度专门化的任务上打败了 GPT-5.6-sol (xhigh) !

这是三天前 Shopify CEO @tobi 分享的团队案例: https://x.com/shao__meng/status/2094940867647992008

今天 Shopify ML 团队 @Drewch 从技术视角给咱们解释明白:为什么这是可能的、方法论是什么、代价是什么?

方法论:数据飞轮 + on-policy self distillation

McNamara 描述的数据闭环,结合他们 ICML 2026 讲座的摘要,可以拆成四步: 1. 可靠评估先行:用人工标注校准的 LLM-as-judge 作为唯一权威指标。没有可信的 judge,后面一切无从谈起。 2. 从生产分布中持续挖错:不是造合成题,而是从真实流量里采样低分输出。这保证了训练数据分布 = 推理时的分布。 3. 用强推理模型 + 人工修复:让高推理模型批判并修正错误输出,必要时升级到人工。关键细节是——不只是给正确答案,而是在训练时给模型"提示",让它自己生成正确的输出。 4. 把修复后的样本折回训练,重跑蒸馏(SFT + on-policy distillation + GRPO),再部署,再采样,循环。

"On-policy self distillation" 为什么重要: · 传统(off-policy)蒸馏是让学生模仿老师写好的答案,但学生自己推理时走的路径和老师不同,训练/推理分布不匹配。 · On-policy 是让学生自己采样轨迹,老师(或带 privileged 提示的自己)在每个 token 上给密集的监督信号。学生学到的是"在我自己会走到的状态下该怎么做"。 · "Self" 意味着 teacher 和 student 可以是同一个模型,只是 teacher 看到了额外信息(hints、正确答案、批判意见),student 只看到原始问题。模型学会在没有提示的情况下复现有提示时的行为。 · 结果就是帖子里那句话:推理能力被写进权重,推理时不再需要"高推理模式"——这直接解释了为什么 0.8B 不用 thinking 就能打 xhigh。

连续空间 vs 离散空间

帖子里最有洞察力的一段,也是对当前业界主流做法的直接批评: 用梯度下降在连续空间里改进,比在离散的词法空间里改进要好得多。

翻译过来:大多数团队修 bug 的方式是往 system prompt 里加规则。这有几个结构性问题: · Prompt 是离散的、脆弱的,加一条规则可能破坏另一条; · Prompt 越长,成本和延迟越高(图里 9.1K tokens 就是这么堆出来的); · 每条规则是人的猜测,不是从数据里学出来的。

而梯度下降是在连续参数空间里做平滑优化,可以同时吸收成千上万条修正案例,不会相互打架。Shopify 另一篇工程博客的说法更直接:"每一轮循环起点是一个更强的模型,而不是一个更复杂的 harness",system prompt 从 9.1K 压到 1.1K 的 gist tokens,正是这个思路的落地——规则进了权重,prompt 就可以瘦下来。

代价:失去泛化能力,但会大幅提升质量、降低延迟和成本

0.8B 模型在 Buyer Profile 上 84.6 分,不代表它能做别的任何事。它本质上是一个"任务专用编译产物"。这对应的适用边界是: · 任务定义清晰、流量大、分布相对稳定; · 有能力构建可信的 judge; · 有持续的生产反馈通道。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近