跳到主内容
@wquguru
精选70BlockTempo 动区(RSS)加密货币多源精选 ×7

阿里发布Qwen3.8-Max,自评超GPT-5.6

阿里巴巴發佈千問 Qwen3.8-Max 自稱贏過 GPT-5.6、Fable 5,真籌碼是超低成本

原文
发到 X

阿里巴巴發布新旗艦模型 Qwen3.8-Max,官方自評稱電腦操作測試贏過 GPT-5.6 Sol Max 與 Fable 5,但跑分未經第三方驗證,開源授權條款也還沒公布。真正讓對手緊張的,是它把每百萬 token 的合計成本壓到 Claude Opus 5 的三分之一以下。

(前情提要:Anthropic 控阿里巴巴「非法竊取」Claude:2880 萬次對話、近 2.5 萬假帳號,蒸餾戰火燒進美國議院)

(背景補充:Kimi K3 登頂前端程式碼榜,真人盲測擊敗 Claude Fable 5)

阿里巴巴旗下 Qwen 團隊昨夜發布新一代旗艦模型 Qwen3.8-Max,在官方發布貼文中宣稱,這款模型在 OSWorld-Verified(電腦操作代理能力測試,衡量模型能不能像人一樣操作桌面軟體)拿下 86.1 分,高於 GPT-5.6 Sol Max 的 83.2 分、Fable 5 的 85.0 分,也把 Gemini 3.1 Pro 的 76.2 分甩開一大截。

86.1 vs 83.2,阿里巴巴贏了三分。但這份成績單目前只有一個裁判,阿里巴巴自己。

Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all! Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: – Autonomous coding: 10+ days of… pic.twitter.com/e3YFj2hqcT — Qwen (@Alibaba_Qwen) August 3, 2026 一張自己打出來的成績單 過去一年,主流大型語言模型的競爭路線其實愈來愈分工。OpenAI 的 GPT 系列主攻通用推理與企業生產力;Anthropic 的 Claude 系列專注寫程式與可靠的長文本推理;Google 的 Gemini 押注多模態與網頁原生工作流;月之暗面(Moonshot AI)的 Kimi K3 則靠「前沿效能+開源權重」硬是插了一腳。Qwen3.8-Max 想做的,是把這幾條路線的長處揉進同一個模型,瞄準的不是聊天助理,而是能連續作業好幾天的「自主員工」。

除了 OSWorld-Verified,Qwen 團隊公布的評測表還列出 PaperBench 93.0 分(衡量重現學術論文實驗的能力)、TerminalBench 2.1 拿下 86.6 分、Vision2Web 69.0 分、LVBench 81.8 分、ERQA 77.8 分,數字相當漂亮。問題是,這些分數全部出自阿里巴巴官方自評,尚未經過任何第三方機構獨立覆核,讀者最好把它們當成廠商的自我報告,而不是客觀成績單。

阿里巴巴官方也宣稱,這套模型特別適合長時間自主寫程式、操作桌面軟體完成重複性業務流程、協助研究機構重現實驗,以及在製造、物流等場景把視覺輸入持續餵回規劃迴圈。換句話說,賣點是「能不吃不喝連續上班」,不是「聊天聊得比較聰明」。

Qwen3.8-Max 是一個混合專家架構(MoE)模型,總參數量達 2.4 兆,但推論時只會實際喚醒約 950 億參數。簡單來說就是,模型內部養了一整支專家團隊,但每次回答問題只點名其中一小群人出勤,不用整團動員,藉此在維持能力的同時把運算成本壓低。它建立在 Qwen3.5 架構之上,上下文視窗一口氣拉到 100 萬 token,等於能一次讀完一整本書再回答問題。

定價才是這次真正讓對手緊張的地方。QwenCloud 定價頁列出,海外市場每百萬 token 輸入 2 美元、輸出 6 美元,中國境內則是人民幣 12 元與 36 元,命中隱式快取還能降到 1.5 元。換算下來,Qwen3.8-Max 輸入輸出合計每百萬 token 只要 8 美元,不到 Claude Opus 5(合計 30 美元)的三分之一,也不到 GPT-5.6 Sol 標準模式(合計 35 美元)的四分之一。跑分打平,價格砍半再砍半,這才是阿里巴巴真正想秀的肌肉。

推論成本之所以敏感,是因為自主代理耗費的 token 量遠超過一般聊天。多輪規劃、反覆自我修正的長流程任務,單一工作就可能吃掉數百萬 token;企業一旦同時跑上百、上千個代理,推論費用很快變成營運成本裡最大的一塊。這股壓力已經外溢:OpenAI 上週才調降 GPT-5.6 中低階模型(Terra、Luna)的 API 價格,降幅分別達 20% 與 80%。Qwen3.8-Max 的低價,某種程度是把這場價格戰又往前推了一把。

沒有一場全勝 把評測表攤開看完整版,會發現 Qwen3.8-Max 並非無所不能。在專業軟體工程測試 SWE-Pro 上,拿下最高分的是 OpenAI 的模型;在部分軟體工程評測與 Agents’ Last Exam(測試模型能不能長時間自主完成任務)上,Anthropic 的 Opus 4.8 仍守住領先位置。阿里巴巴官方公布的比較表其實也承認,Qwen3.8-Max 提供的是「均衡」而非「全面最強」的表現組合,這句話本身,已經比多數廠商的公關稿誠實。

更值得留意的是,阿里巴巴宣稱 Qwen3.8-Max 能自主完成長達 10 天以上的軟體專案、重現動輒數千行程式碼的研究論文、進行晶片設計的迭代最佳化,還能靠多模態回饋持續修正計畫。這些示範同樣全部出自公司內部,尚未經過獨立驗證,聽起來像是能力越強,宣稱的規模也跟著越誇張。

開源的但書 阿里巴巴同時預告,下週將在 Hugging Face 與 ModelScope 開源 Qwen3.8-Max 權重,並同步發布較小的 Qwen3.8-...

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源
阿里云Qwen 3.8-Max发布首日获多平台接入
深潮 TechFlow(RSS)原文
阿里发布Qwen3.8-Max,参数达2.4万亿
Crypto Briefing(RSS)原文
阿里巴巴发布千问3.8-MAX人工智能模型
ChainCatcher 链捕手(Telegram)原文
阿里巴巴发布千问3.8-MAX模型,参数2.4万亿
律动 BlockBeats(Telegram)原文

相似阅读

另一事件,读法相近