跳到主内容
@wquguru
精选88AYiAI 产品与模型

Claude Code effort旋钮用法解析:是加班时长而非智商档位

Thariq这篇关于Claude Code effort旋钮的文章,看完直接把我之前的用法全推翻了,简直就是大师级Claude调参课,

原文
发到 X
推荐理由

结构完整且包含大量具体实验数据与对比案例,将抽象的参数调整转化为可操作的工作流建议,对同行极具参考价值。

Thariq这篇关于Claude Code effort旋钮的文章,看完直接把我之前的用法全推翻了,简直就是大师级Claude调参课,

我敢说绝大多数人都理解错了。 effort旋钮不是模型智商档位, 是你允许它加班多久。

同一台模型,同一套知识。 拧低,它尽快给你一个能用的版本,把你留在循环里一起改。 拧高,它会自己多做验证,多挖边角案例,多自己做判断,少等你点头。

那个类比特别准, 别人给你1小时,你先交一个能交差的版本,心里已经准备好下一轮改。 别人给你12小时,你会默认他们要成品,自己去补测试,补边界,补你觉得该有但没写清的东西。 effort就是在跟Claude说这句话。

新模型工程上最牛的一点, 调effort不会把prompt cache打爆,上下文还能复用。 同一段对话里,你可以先低档写,再高档验。 不必重开会话,不必把前面几万token再付一遍。 会话中途打/effort就能切。

没有这个旋钮会怎样呢? 模型要么永远快但漏坑,要么永远慢且爱自作主张。 现在把速度和验得有多狠,从模型智商里拆出来,交给你控。 注意,effort控的是投入,不是知识上限。 模型选的是能力档,effort选的是这档能力愿意花多少力气。

它实际改的,就是三件事:

验证做多少。 低档写完测一两个例子就停。 高档对参考实现,跑官方测试套,自己写随机fuzzer。

边角案例挖多深。 安全,硬件,老代码修bug,坑都藏在你没想到的那条路径里。 高effort主要就是在打这些坑。

自己替你做多少决定。 需求含糊时,低档给你一个简陋起点等你改。 高档会自己补功能,自己定交互,自己简化设计。 所以高档不一定更听话,有时是更自作主张。

还有那条失败分界线很重要。 漏边角的问题,加effort能明显减少。 路子就走错了的,加effort基本救不回来。 方向错了,加班也只是把错的方案打磨得更精致。 需求写错,架构选错,别指望把旋钮拧到max就自动纠正。

三个实验,是全文最有教学价值的部分。 他拿同一类任务,按你给它多少规格,做了三组对照。

第一组,需求很糊,就说做个健身打卡App。 low一分半,一个日志加一张简单图。 medium四分钟,功能多一点细节多一点。 high十一分钟,更完整。 max六十七分钟,复杂到带热力图。

同一句话,低档给你草稿,max给你它心目中的成品。 如果你要的是迭代起点,低档完胜。 如果你要一次出片不想盯着,才上max。

第二组,需求中等,让它重做Claude Code的/config菜单。 每个档次想的方向差不多,子菜单加更好的搜索。 差别在完成度。 low一分钟,交互草图,意思到了,看起来不像正品。 max二十八分钟,很像真的Claude Code,还附带各种流程走查。

作者自己的偏好特别反直觉。 这种我想看看它怎么想的活,他更爱低档。 因为一分钟就能看到方向,再给反馈。 二十八分钟出的精致稿,你可能只想改一个结构,前面那些打磨全废了。

第三组,需求很清楚。 先让它采访你,再按规格实现。 档次一拉高,产品长得开始像了,实现也接近。 max甚至会回头简化一些细节,而不是继续堆功能。 时间从low十六分钟,到max七十九分钟。

结论很清楚。 规格写清楚之后,effort主要买的是打磨和验收,不是另一个产品。 需求越糊,effort越像产品经理。 需求越清,effort越像QA。

玩具任务看不出差距,去看会挂掉的题。 作者承认上面都是Claude本来就会的活。 真正拉开差距的,是Terminal Bench 3.0那种社区难题。 硬件,安全,ML,科学形式化证明,运营流程。 这些比日常写业务代码难一个数量级。

Fable 5.1内部评测,每档大约370次尝试。 low过140题,中位约7.3万token。 max过214题,中位约22.2万token。

按领域看,低档到高档提升最猛的。 安全从64%到87%。 硬件从34%到75%。 ML从54%到73%。 科学从41%到61%。

软件媒体运营也涨,但没那么夸张。 规则手册式按流程填的活,effort提升很小。 因为瓶颈不在验得够不够,在第一步就理解错了。

四个真人案例,把抽象分数还原成行为。 你就知道高档到底在加班干什么。

第一个,HTML消毒器,防各种把JS塞进页面的方式。 low约2分钟,一遍写完,拿手写的一页测一下。 xhigh约33分钟。 先对自己初稿做对抗审查,去读已安装解析器源码找洞。 跑干净用例确认不该改的别改,再跑标准XSS套件。 最后写随机文档fuzzer。 安全这种你漏一种走私方式就全盘翻车的题,多花token是划算的。

第二个,存储引擎修bug,修崩溃,还不能把压缩搞坏。 low约1分钟,没复现就改,也不确认新测试能不能抓住原bug。 xhigh约11分钟。 先复现崩溃,对着永不压缩的参考实现写随机测试。 再检查半成品修复会不会被测试打掉。

第三个,命令行线性规划求解器。 low一遍写完,几个小例子过了就停,自己还提醒大题可能慢,但没去验证。0/5。 high对着暴力求解器测随机题,再给大题计时。 撞上超时崩溃后重做搜索策略。

第四个,蛋白质组学的基因集富集分析。 low选一种看起来合理的数据预处理,跑一次,交差。0/5。 high试两种预处理,发现显著处理列表变了,追原因,再选对的那种。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

关联信息,但可能不是同一事件