实测Grok 4.7:长程复杂任务推理能力显著提升,但Token消耗翻倍
刚花了一下午玩了下新发布的Grok 4.7,说下真实感受。
提供了具体的基准测试数据对比和极具画面感的自定义测试案例,结构清晰,并给出了基于Token消耗的实用使用建议,写法值得参考。
刚花了一下午玩了下新发布的Grok 4.7,说下真实感受。
整体来说老马这次有些克制,Grok4.7不是那种让你一开口就喊牛逼的模型,日常写个函数、改个小 Bug 几乎感觉不到和 4.6 的区别,
但是一旦把任务拉长,比如跨文件排错、在终端里连续跑几十分钟不断调整方案,它和 4.6 就不是一个物种了,
这次底座换大了,官方确认训练重心偏向了要花好几小时才做完的长难任务。
在多小时终端代理的标准测试里,成功率从 20.3% 拉到了 38%,几乎翻倍,电气工程测试达到 64% 也明显高于竞品。更值得注意的是第三方拆出来的分析质量分,从 1690 飙到了 1994,但呈现和排版基本没变。
它进化的不是表面功夫,核心在深度推理和长上下文里自己核验自己的内功。
为了试它到底有没有在复杂约束下一次把活干完的能力,我出了道反常识考题:手写一个自行车骑鹈鹕的纯前端 3D 交互网页,
跑了半个小时,最后吐出来 580 多行原生代码,零外部依赖,自行车在鹈鹕背上,缰绳从车把拉到鸟嘴,双翼各有独立的扑腾频率,脚踏曲柄自转,鼠标划过去整个场景在三维空间里平滑旋转。
谁骑谁、部件之间什么关系、运动层级怎么嵌套,全对。
不过有一件事必须提前说清楚,官方那张对比表里有个坑,4.7 跑的是极高思考档位,4.6 跑的是普通高档位,单次任务的输出 Token 从大约 36k 涨到了 81k。
同单价没错,但单次任务实际消耗翻了倍多,而且提示词超过 20 万 Token 价格直接翻倍,
所以大家千万别把所有任务无脑切过去,日常短活用 4.6 或者普通高档更省钱,只有在 Cursor 或 Grok Build 里啃那些容易卡死、需要反复排错的跨文件重活,才值得让 4.7 拉满档位下场。
总的来说,它不是全面超越所有模型的东西,纯编码天花板还在 Anthropic 那边,临床推理也打不过 Fable。
但在这个价位上,它可能是目前最适合当长程主力工具的选择,写短注释的时候你不会感谢它,在终端里被一个诡异 Bug 折磨两小时、它替你逐步自检排查出来的时候,你一定会的哈哈
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力