Grok 4.6 发布:长程 Agent 与视觉交互增强
Grok 4.6 果然来了,老马诚不欺我,甚至很期待 Grok 4.7
Grok 4.6 果然来了,老马诚不欺我,甚至很期待 Grok 4.7
现在 Grok Build, Cursor, Grok Bot 和 API 已经可用,感觉我的 Cursor Ultra 订阅含金量还在上升!
Grok 4.6 在 4.5 的基础上,专门加强两件事: 1. 长程 Agent:能在多步任务里待得住——调研、分析、改代码库、把一个想法做成可用产物。 2. 更重的交互与视觉工作:给一个具体产品想法,一次性把应用结构和视觉语言立起来,再进入迭代。
Grok 团队自己的测试观察还包括:更长轨迹上出现更多自测与核验;视觉/交互项目的第一稿明显强于 4.5。
规格上,Grok 4.6 是当前最强也最快的文本模型:grok-4.6,上下文 50 万 token,文本 + 图像进、文本出,支持函数调用、结构化输出和推理。
评测:相对自己是代际跃迁,相对 SOTA 是进入梯队 官方用 Grok 4.6 High 对比 Grok 4.5 High、GPT-5.6 Sol Max、Fable 5 Max。Artificial Analysis 综合指数上,4.6 得 61,与 GPT-5.6 Sol Max 持平,比 4.5 的 56 高 5 分,距 Fable 5 Max 的 62 只差 1 分。
相对 4.5,10 项全升。涨得最狠的是需要真正动手的任务:DeepSWE 54% → 65.9%,APEX-Agents 47.1% → 57.5%,Terminal-Bench 15.7% → 26%。知识工作 Elo 同样跳得很明显:GDPVal-AA 1526 → 1753,AA-Briefcase 1313 → 1577。编码相关里,APEX-SWE 只加了 2.8 个百分点,说明“写软件”这条线的提升并不均匀。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力