跳到主内容
精选7521世纪经济报道股市多源精选 ×5

阿里智谱同日发布高性价比MoE模型,推理成本大幅下降

阿里智谱同日上新,每百万Tokens低至0.8元

原文
推荐理由

AI大模型厂商同日发布高性价比MoE模型,并大幅下调推理定价,直接影响AI算力与云服务产业链的投资逻辑,建议关注相关标的与成本竞争格局。

记者丨董静怡

编辑丨包芳鸣

8月26日,阿里、智谱两款“高性价比”模型同日发布。

阿里通义千问正式发布Qwen3.8‑Flash,智谱AI上线并开源GLM‑5.3‑Flash,两款产品均采用混合专家MoE架构。前者为下一代Qwen4架构的先导预览版,MoE总参数125B,每Token仅激活6B参数;后者是GLM‑5系列首个原生多模态模型,总参数320B,单Token激活18B参数。

两个模型都对外开源权重,主打高并发、低成本、原生多模态与Agent能力,引发社区关注。发布还不足24小时,阿里云把Qwen3.8-Flash的定价又砍了一刀——输入每百万Tokens 0.8元,输出2.7元。

用更少的计算资源,做更多的事,Flash成了大模型厂商心照不宣的新方向。参数不再是竞赛的唯一标尺,效率、成本和落地能力正在重新定义游戏规则。

竞赛换了计分牌

Qwen3.8‑Flash与GLM‑5.3‑Flash,代表国内大模型厂商对Flash路线的落地,二者在技术路径上既有共识,也存在差异化取舍。

阿里Qwen3.8‑Flash主模型总参数125B,叠加51B N‑gram Embedding记忆库,但每一次Token生成,仅激活6B参数参与计算,这也是其推理成本大幅下降的核心原因。

架构层面,Qwen3.8-Flash引入了GDN与QSA混合注意力机制,在高缓存命中的百万Token长上下文场景中可提速8倍以上。

训练成本较前代Qwen3.7-Plus骤降近90%,推理成本同样大幅下降,推理定价每百万Tokens输入1元、输出3元,最低仅为DeepSeek-V4-Flash的三分之一。发布次日降价后,输入每百万Tokens 0.8元,输出2.7元。

几乎同一时间登场的GLM‑5.3‑Flash,总参数320B,单Token激活仅18B,采用稀疏注意力+线性注意力混合架构,是GLM‑5系列第一个原生多模态基座。

API价格仅为GLM-5.3的十分之一,限时折扣阶段进一步降至二十分之一,约为Claude Opus 4.8的四十分之一。

正式发布前,该模型以匿名模型Ox-Alpha在OpenRouter、OpenCode两大海外平台测试,迅速登顶并刷新双平台历史纪录,Token调用量高达62T。8月27日港股收盘,智谱全日收涨12.62%,报1160港元/股,最新市值5401亿港元。

放在两年前,行业主流认知依旧是稠密模型效果更稳,MoE被视作“看上去很美,但落地麻烦”的备选方案。但2026年,MoE‑Flash已经从备选变成主流。

背后是大模型产业迎来商业化的关键拐点。经历过去几年的疯狂烧钱,行业已经不再满足于实验室里的榜单分数,企业客户、开发者最关心三件事:单位Token成本、真实业务任务成功率、部署灵活性。

背后有两层现实约束。第一,稠密模型的推理成本天花板很难突破,千亿稠密模型高并发场景下,算力开销会直接吞噬企业客户的AI预算,很多企业即便看到强大的模型能力,也无法大规模落地;

第二,长上下文、多模态、Agent智能体成为刚需,文档解析、办公自动化、代码全链路任务,对知识储量要求极高,单纯小稠密模型很难胜任复杂任务,单纯做大稠密模型又会陷入算力不可承受的死循环。

第三,MoE‑Flash恰好提供折中解法,接近旗舰的综合能力,推理成本下降一个数量级,让大规模商用从经济上变得可行。

放眼国内其他厂商,也能看到高度相似的迭代节奏。腾讯7月发布混元Hy3极致量化版本,总参数量295B,单Token激活21B,同样追求大知识底座、低部署门槛;DeepSeek持续迭代V4‑Flash,依靠MoE架构在代码、长文本领域形成性价比优势;海外谷歌Gemini Flash系列,长期坚持“旗舰能力下探、推理成本大幅下降”的产品策略,成为云服务商最主要的流量载体。

重写AI成本账

Flash模型的集中发布,正在重塑行业商业逻辑,同时也在改写国产模型出海的竞争格局。

阿里Qwen3.8‑Flash训练成本相比前代下降九成,GLM‑5.3‑Flash价格仅为自家上一代旗舰的十分之一,这种成本下降源于稀疏激活、注意力优化、缓存压缩等底层技术,构成了可长期持续的成本优势。

“过去降价是赔本换流量,现在架构带来成本下降,厂商可以在合理毛利区间内持续压低对外报价。”有AI云厂商技术负责人向记者评价称。

因此对于大模型厂商来说,这并不是打价格战,而是技术路线的选择。

“降价和提升毛利率并非矛盾。只要单位Token毛利率仍然保持正向,并且持续改善毛利,规模扩大就会带来更高的绝对毛利。”MiniMax CEO闫俊杰在财报会议上表示,成本下降后,一部分收益让给客户降低门槛,一部分保留改善毛利。

横向对比,中国模型的定价仅为国际顶尖闭源模型的数十分之一。中小企业、垂直行业客户不再完全依赖大厂闭源API,拥有更多选型空间。据Hugging Face《2026年春季全球开源AI生态报告》,中国开源模型下载占比已达41%,首次超过美国,累计下载量突破100亿次。

这会倒逼闭源商业API持续下调价格,加速全球大模型的价格内卷。

8月,OpenAI宣布对GPT-5.6 Sol进行“限时促销”,价格下调逾20%。这已是OpenAI近一个月内的第二轮降价。就在7月底,同系列的GPT-5.6 Luna价格刚被下调了80%。

有分析认为,中国AI企业通过开源权重策略快速提升了价格竞争力,在全球市场影响力持续扩大,由此引发的市场价格战正迫使美国企业跟进。

此外,算力格局迎来变化,国产算力大规模承接MoE推理,算力需求结构发生转移。

智谱GLM‑5.3‑Flash是国内前沿大模型首次大规模线上流量完全跑在国产算力之上,具备标志性意义。智谱称,通过推理系统改造,硬件效率和单Token成本已达到与主流英伟达GPU相当的水平。

MoE架构本身对算力互联、显存带宽、调度框架提出极高要求,过去国产芯片普遍被诟病难以承载千亿级MoE大模型。而Flash版本通过稀疏激活,降低单Token计算压力,让国产算力有机会承接前沿模型,反过来,国产算力的成熟,又进一步压低Flash模型的推理成本,形成正向循环。

当然,Flash模型不会彻底取代稠密旗舰大模型。对于最高难度科研推理、复杂风险决策场景,稠密旗舰模型依旧代表能力上限。整个市场会形成分层格局,共同构成产业的供给底座。

SFC

出品丨21财经客户端 21世纪经济报道

编辑丨刘雪莹

21君荐读

光模块牛股半年净赚60亿元,尾盘直线涨停,股民直呼“不可思议”

549亿市值、半年净利7000万元,宇树影子股股价回撤超48%

深圳高校AI班,挤满600分以上考生

作者: 21世纪经济报道

查看原文 →

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近