跳到主内容
@wquguru
精选75通往AGI之路研究与分析

百度千帆Token Plan实测:DeepSeek/GLM/Kimi模型横评

百度千帆Token Plan实测:DeepSeek-V4、GLM-5.2、Kimi-K2.6,同一个任务谁更强?

原文
发到 X

WaytoAGI

DeepSeek-V4、GLM-5.2、Kimi-K2.6 横向实测

一份订阅共享多款模型,24 组实测告诉你什么活儿该给谁

WaytoAGI900万+学习者的AI原生社区

自从用上了 Codex 和 Claude 后,发现 Token 远远不够用,没跑几个任务就又要等重置了。

不过这两天我发现,百度推出了「千帆Token Plan」,是从之前的 Coding Plan 升级来的。

这次不仅统一了计费模式,GLM、DeepSeek、Kimi、文心等模型都能共享额度,还把高峰时段限流给取消了。

01 Token Plan 划算吗?

目前 Token Plan 个人版还有首购优惠,Pro 进阶版 99.9 元能买 2.3 亿 Token!如果想尝个鲜,也可以花 4.9 元试一下 Mini 版本。

如果你对这个价格没什么概念,换算一下就清楚了。

因为这次用的是通用 Token 统一抵扣机制,也就是不区分模型倍率,不区分输入、输出、缓存命中,所有调用都按实际 Token 消耗量统一扣减套餐额度。

拿我买的 Pro 版本来算,99.9 元首购价,每百万 Token 约 0.43 元。

假设输入输出是 3:1,用价格最低的 DeepSeek-V4-Flash 来对比,每百万 Token 的综合成本是 1.25 元。

所以,在额度全部用完、缓存命中率不高的情况下,Token Plan 连最便宜的 Flash 都能打赢,使用其他价格更高的模型自然更划算。重要的是 Token Plan 能随意切换模型,对于 AI 编程重度用户非常方便划算。

当前百度千帆 Token Plan 支持的模型:ERNIE-5.1、GLM-5.2、GLM-5.1、Kimi-K2.6、DeepSeek-V4-Pro、DeepSeek-V4-Flash

而且 Token Plan 兼容多个接口,官方提供了详细的接入指南,不管你在用 Codex、Claude Code,还是 OpenClaw、Cursor 都支持。

当前百度千帆 Token Plan 支持接入的主流工具:OpenClaw、Claude Code、Cursor、Cline、Kilo Code、OpenCode、Cherry Studio、CodeX、Qwen、Kilo CLI、CC-Switch。

02 3 大模型实测

2.3 亿 Token 到手,还有这么多模型能选,那么新的问题来了:不同的任务该给谁做?Token 消耗情况如何?

为了验证这个问题,我分别用 GLM-5.2、Kimi-K2.6、DeepSeek-V4-Pro 这 3 个模型,测试了「代码生成、长文总结、中文创作、数据核算」这 4 类任务中的表现。

  • 代码生成:给 WaytoAGI 社区做一个活动单页官网(要求单文件、深色科技风、响应式、禁用外部资源)
  • 长文总结:把一份 3 万字的直播逐字稿整理成回顾大纲 + 摘要 + 3 条金句(金句必须是原话)
  • 中文创作:为一场直播写 5 个公众号标题 + 导语 + 小红书笔记
  • 数据核算:一份埋了异常数据的活动报名表,算转化率、找出异常

方式:把 Token Plan 的 Key 配置到 Claude Code,在统一任务、设置和上下文下逐项完成测试。3 个模型分别完成 4 项任务,每项保留 2 轮有效结果,共 24 组,并记录响应速度和 Token 消耗。

注意:这是一轮统一环境下的多模型专项横评,结果反映各模型在本组任务中的表现,不代表所有场景下的固定排名。

先说结论:

GLM-5.2 综合表现最稳;DeepSeek-V4-Pro 做偏视觉的活动网站完成度最高;Kimi-K2.6 的长文大纲最细。

没有一个模型包揽全部任务,按任务切换模型,正是 Token Plan 最实用的地方。

我还把所有测试结果都放到了这个网站上,打开就能直观看到(需要一点科技):

https://qianfan-tokenplan-review.vercel.app

03 横向测试结果

第一场 建站需求

这一次的测试结果最直观。同一段 prompt,要求做“AI 共学节 2026”活动官网。

代码 · 1
你是一名资深前端工程师。请为「通往 AGI 之路(WaytoAGI)」社区的年度活动制作一个单页活动官网。活动信息如下(页面内容以此为准,不要编造其他事实):- 活动名称:AI 共学节 2026- 主办方:WaytoAGI 通往 AGI 之路社区- 时间:2026 年 8 月 22 日(周六)10:00 - 18:00- 地点:上海·西岸智塔 45F- Slogan:一起用 AI,做出真东西- 社区数据:120,000+ 社区成员 / 8,000+ 篇共创知识库文档 / 300+ 场线下活动 / 覆盖 40+ 城市- 日程:  10:00 开场:社区年度回顾  10:30 主题演讲:Agent 时代的个人生产力  11:30 圆桌:AI 内容创作的一年  14:00 工作坊 A:从零做一个 AI 小工具  14:00 工作坊 B:AI 视频创作实战  16:30 Demo 之夜:社区作品路演- 嘉宾(姓名 / 头衔):  柒杯 / WaytoAGI 社区发起人  林一舟 / 独立开发者,AI 工具「快改」作者  苏晚 / 千万粉 AI 视觉创作者  陈屿 / 某大厂 Agent 平台产品负责人- 底部报名按钮文案:立即报名,limited 300 席要求:1. 单文件 HTML,所有 CSS 和 JS 内联,保存后双击即可在浏览器打开2. 深色科技风,有设计感,配色和排版体现 AI 社区的先锋气质3. 包含:顶部导航、Hero 区(含报名 CTA)、社区数据栏、日程表、嘉宾卡片、底部报名区4. 响应式,手机上也能正常浏览5. 禁止引用任何外部资源(图片、字体、JS/CSS 库都不行),图标用 emoji 或内联 SVG,嘉宾头像用首字母或渐变色块代替6. 可以加适度的滚动或悬停动效请直接输出完整的 HTML 代码。

实测下来,网页都能正常打开,没有加载外部图片、字体或代码库。基础可用性拉不开差距,主要差别在视觉完成度、信息组织和 Token 消耗。

  • DeepSeek-V4-Pro:这组视觉完成度最高。星空粒子背景、渐变标题、彩色时间轴和嘉宾卡片都有完整设计,但单次输出约 1 万到 1.5 万 Token
  • GLM-5.2:完成度和用量平衡得最好。极光渐变、分类标签、并行工作坊卡片都做出来了,平均输出约 6200 Token,接近 DeepSeek-V4-Pro 的一半
  • Kimi-K2.6:干净利落的青色系设计,结构完整,但生成过程最慢,两轮分别用了 202 秒和 209 秒

同一段 prompt,3 个模型各自交出的整页效果。

>> 左右滑动查看

从左到右:DeepSeek-V4-Pro、GLM-5.2、Kimi-K2.6

第二场 3 万字逐字稿总结

长文总结最大的风险是幻觉。所以这次测试,我把前两天社区“晚 8 点共学”的直播逐字稿丢给了这 3 个模型,并且在任务里特意要求:3 条金句必须是嘉宾原话。

代码 · 1
你是一个 AI 社区的公众号编辑。下面是一场直播活动的完整逐字稿(约 3 万字),请基于它完成:1. 一段 150 字以内的内容摘要2. 一份活动回顾文章大纲:按主题分 5~8 个部分,每部分附 2~3 条逐字稿里的具体信息点(工具名、操作步骤、数据等),要具体到能直接指导写作3. 挑出 3 条最适合传播的嘉宾金句,必须是逐字稿中的原话(可轻度整理口语),并标注大致时间点4. 提炼 3 个最有传播价值的亮点,说明理由注意:所有内容必须来自逐字稿本身,不要添加逐字稿中没有的信息。逐字稿如下:(此处后接 3 万字逐字稿全文,见 素材-0713直播逐字稿.md)

测完我把每一条金句拿回逐字稿里逐字核对,这一项拉开了真正的差距:

  • GLM-5.2:3 条金句逐字准确,时间戳精确到和逐字稿完全对上,是唯一做到“原话 + 准确时间戳”双达标的模型
  • Kimi-K2.6:3 条金句真实,回顾大纲是本轮最细的,具体到工具名和操作步骤,直接可以照着写稿;但时间戳偏差较大
  • DeepSeek-V4-Pro:3 条金句里有 2 条把逐字稿不同位置的话拼接改写,意思接近,但已经不符合“原话”要求

在这组任务里,逐字稿整理可优先考虑 GLM-5.2;如果更看重大纲的细度,可以选 Kimi-K2.6。无论用哪个模型,公开引用前都建议人工回核。

>> 左右滑动查看

从左到右:DeepSeek-V4-Pro、GLM-5.2、Kimi-K2.6

第三场 写标题和小红书

文案任务往往没有标准答案,所以这个按照公众号编辑的日常标准来看,主要是标题有没有信息量、小红书像不像真人发的。

代码 · 1
你是「通往 AGI 之路(WaytoAGI)」公众号的编辑。我们刚办完一场直播,需要产出传播文案。活动信息:- 主题:自媒体套件详解,一站式搞定内容创作全流程- 时间:7 月 13 日 19:00,已结束,现在写的是回顾传播文案- 嘉宾:上分吧Pt(千万级 AI 视觉创作者)- 主持:高雁(WaytoAGI 企业服务负责人)- 直播核心内容:灵感留存多端同步、图文/短视频一键创作、热点追踪选题策划、数据复盘优化内容- 直播中演示了用百度自媒体套件从选题到发布的完整流程- 直播间福利:抽 DuMate Pro 月会员 + 百度周边盲盒请输出:1.5 个公众号回顾文章备选标题(要有信息量,避免纯情绪化标题党)2. 一段 50 字以内的文章导语3. 一篇 300 字以内的小红书笔记版本(含 emoji 和 3~5 个话题标签)
  • GLM-5.2 的标题最工整,而且没让我要求,自己在文末附了一份事实核查清单,标注每条信息的来源,这个职业习惯直接戳中编辑
  • Kimi-K2.6 同样主动附了出处清单,内容扎实,但两轮平均输出约 3700 Token,约为 DeepSeek-V4-Pro 的 5.5 倍;平均总耗时约 72 秒,展开得最充分,等待时间也最长
  • DeepSeek-V4-Pro 补写了提示词没有提供的活动信息,发布前需要人工复核

>> 左右滑动查看

完整测试结果在此查看:https://qianfan-tokenplan-review.vercel.app/

从左到右:DeepSeek-V4-Pro、GLM-5.2、Kimi-K2.6

第四场 数据核算,全员满分之后看效率

这个测试是埋了异常的报名数据表,结果 3 个模型 6 轮全部满分。

代码 · 1
你是活动运营的数据分析师。下面是一场线下活动的渠道数据,请完成核算与分析。各渠道数据(报名人数 / 实际签到 / 会后加群):- 公众号:420 / 268 / 199- 小红书:275 / 154 / 88- 社群直发:310 / 241 / 205- 官网表单:95 / 112 / 61成本:场地 18000 元,物料 3600 元,直播设备租赁 2400 元。请回答:1. 计算各渠道的签到率(签到/报名,百分比保留一位小数)2. 计算整体签到率3. 按实际签到人数计算人均成本(保留两位小数)4. 这份数据中有一处明显异常,请找出来并给出至少两种可能的原因5. 如果下次活动预算不变、目标签到 900 人,你会优先加投哪个渠道?给出推理过程请展示计算过程。

转化率全算对、人均成本全算对、“签到人数比报名还多”的异常全部揪出来了,还都给出了合理解释。

>> 左右滑动查看

从左到右:DeepSeek-V4-Pro、GLM-5.2、Kimi-K2.6

这个难度的运营核算已经很难拉开质量差距,主要看效率。

DeepSeek-v4-pro 约 30 秒,GLM-5.2 平均约 32 秒完成,Kimi-K2.6 约 53 秒。只看输出 Token,最高与最低约为 1.9 倍;计入输入后,差距会缩小。

04 模型成绩单

24 组有效结果的完整数据如下:

质量分为 4 项任务的人工评分均值,满分 10;性价比分按“平均质量分 ÷ 单次平均总 Token × 10000”计算,总 Token 包含输入、输出和缓存命中。分数越高,表示这组任务中取得同等质量所需的 Token 越少。

几个我自己都没想到的发现:

  • GLM-5.2 综合表现最稳:质量分最高,平均总耗时最短,总 Token 最少,性价比分第一
  • Kimi-K2.6 更愿意展开细节:它的大纲最细,输出 Token 约为 GLM 的 2.1 倍;计入输入和缓存命中后,全程总 Token 约高 32%
  • 模型要按任务选:DeepSeek-V4-Pro 在建站任务中得分最高,长文保真却失分;这轮没有一个模型四场全赢

最后算一笔总账的话,整个测评的 24 组有效结果共消耗 249,089 Token,占 Pro 版月度额度约 0.11%。

按当时百度千帆平台的后付费价格逐条估算约需 4.10 元;按 99.9 元首购价折算约 0.11 元,按 200 元标准月费折算约 0.22 元。

05 结论:什么活儿用什么模型

测完这一轮,我自己的模型分工表已经定了:

这张分工表能成立,关键在 Token Plan 的产品形态:一份订阅里放进多款模型,共享同一 Token 池。

写代码时选 DeepSeek-V4-Pro,整理逐字稿时换 GLM-5.2,需要细大纲时再用 Kimi-K2.6。

不必分别维护几家的充值账户,也不用为了切模型再买一份订阅。

对每天在建站、写稿、总结和核算之间来回切换的人来说,Token Plan 的核心价值就在这里,每项任务都能调用当下更合适的模型。

06 如何购买百度千帆 Token Plan

产品入口:https://console.bce.baidu.com/qianfan/resource/token-plan

标准月费:Mini 9.9 元、Lite 40 元、Pro 200 元、Max 600 元

首购活动:每日 10 点限量开放五折购买,Mini 4.9 元起,活动时间、价格和库存以购买页为准

使用文档:https://cloud.baidu.com/doc/qianfan/s/Dmrabu8b6

👀 近期看点

如何让飞书真正替你干活?「AI绝活大会」干货替你整理好了

WAIC逛展全攻略!175 场论坛 + 全城边会,都在这俩网站里了

报名开启!AMD AI DevMaster 全球黑客松等你来战

73个飞书文档,1小时变网站|AJ在D20峰会的Vibe Design实践

超划算的Token使用方式出来了

查看原文 →

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近