MiniMax H3开源,文生视频榜反超Seedance 2.0,价格近半
MiniMax H3 開源「打趴」Seedance 2.0?價格近乎砍半、文生影片榜反超,12GB 顯示卡就能跑
MiniMax 於 8 月 3 日將全模態影片模型 H3 的權重上架 Hugging Face,2K、24fps 影片與立體聲音訊一次生成;在 Artificial Analysis 競技場上,H3 拿下影片編輯榜第一、文生影片榜反超字節跳動 Seedance 2.0,5 秒片段成本 0.7 美元僅為對手 57 折,社群更實測 12GB 消費級顯示卡即可離線執行。本文整理雙方規格、榜單與生成案例對比。
(前情提要:MiniMax 發表全模態模型 H3:圖、影片、聲音一次生成,承諾近日開源)
(背景補充:字節跳動 Seedance 2.5 發布:升級 30 秒影片+50 份參考,推出合規版權模板 首波合作周星馳)
中國 AI 影片賽道在這個夏天正式分裂成兩條路線:字節跳動把 Seedance 鎖進自家 App 與 API 高牆,MiniMax 則選擇把底牌直接攤在桌上。7 月 31 日透過 API 發表全模態影片模型 H3 後,MiniMax 僅隔三天就在 8 月 3 日宣布正式開放權重,模型檔案同步上架 Hugging Face,ComfyUI 當天就合併原生支援。一週之內,第三方量化版、工作流模板、API 聚合平台全數跟上——這種生態擴散速度,正是閉源的 Seedance 給不了的。
33B 全模態架構:文字、影像、影片、聲音讀進同一條上下文 根據官方模型卡,H3 是一顆 33B 引數的稠密 Transformer(其中約 13B 位於推論時毋須載入的 AdaLN 調變分支),核心賣點是「全模態」(omni-modal):文字、影像、影片、音訊被讀進同一條上下文,再一次性生成最長 15 秒、24fps 的影片,並同步輸出 32kHz 立體聲音訊——對白、音效、環境音與畫面同時誕生,而不是先生成無聲影片再靠後製配音對嘴。
單次生成最多可掛 9 張參考圖、3 段參考影片與 3 段參考音訊,支援文生影片(T2VA)、首尾幀控制(FL2VA)與參考生成(Ref2VA)三種模式,涵蓋 21:9 到 9:16 六種畫幅、11 種語言的穩定對白。開源部分為 768p 的 H3-Base 主模型;2K 輸出則靠 API 端的 H3-Regenerate-2K 上取樣模組完成——這也是後文會提到的開源保留項。
對決 Seedance 2.0:三張榜單兩勝一負,價格只要 57 折 Seedance 2.0 是字節跳動今年 2 月發表的旗艦,同樣主打影音聯合生成、多鏡頭角色一致性,並在後續升級中拿到原生 4K、10-bit 色深,馬斯克也曾公開稱讚其進展速度。單看畫質規格,Seedance 依然是紙面最強者之一,但把榜單、價格與可得性攤開,天平明顯在傾斜。
依 Artificial Analysis 影片競技場 8 月初的統計,三張主要榜單呈現「兩勝一負」格局: 榜單(含音訊)
第一名 MiniMax H3 Seedance 2.0 影片編輯 MiniMax H3(1,130)
第 1 名 未入榜 文生影片 Gemini Omni Flash(1,245)
第 2 名(1,234)
第 3 名(1,221)
圖生影片 Seedance 2.0 720p(1,196)
第 3 名(1,187)
第 1 名 價格差距則更為直觀:同樣生成 5 秒片段,H3 的 2K 輸出約 0.70 美元,Seedance 2.0 的 720p 輸出因採 token 計費反而要價約 1.22 美元——H3 用更高解析度打出近乎對折的價格;換算到 1080p 級距,第三方估算 H3 每分鐘約 7.8 美元、Seedance 2.0 約 22.45 美元,相差近三倍。
而最關鍵的分野在可得性:Seedance 2.0 曾因好萊塢版權爭議一度急停全球發布,6 月發表的 Seedance 2.5 也維持閉源、繫結自家平台;H3 的權重就躺在 Hugging Face 上,任何開發者今天就能下載微調。值得一提的是,H3 採用的是自訂的「MiniMax H3 Community License」社群授權而非標準開源授權,對特定地區與使用情境設有限制,商用前仍須細讀條款。
生成案例:遊戲過場、一鍵對嘴、電商影片 開源一週以來,官方與社群已累積不少實際案例。官方展示的遊戲過場 Demo 中,H3 一次生成古代水神殿、發光神器、巨型石像守衛與逃脫橋段的完整運鏡,並附帶同步音效: Build your first game demo with H3 https://t.co/p3c37gQrD3 — Hailuo AI-MiniMax Design (@Hailuo_AI) August 2, 2026 MiniMax 亦宣布 fal 等平台成為 Day 0 合作夥伴,Luma 隨後也在 8 月 6 日把 H3 接入其多模型 Agents 產品。fal 官方整理的 Prompt 指南收錄了 44 支生成範例,涵蓋產品廣告、角色敘事與介面動畫;ComfyUI 官方教學則提供文生影片、圖生影片與參考生成三套現成工作流。
社群端的玩法更具指標性。電商工具 WeShop 展示了「一張產品圖+一支爆款參考影片」的工作流:H3 直接把參考影片的節奏、鏡頭結構與帶貨風格轉移到自家商品上,產出可直接投放 TikTok、Reels 的短影音。對嘴(lip-sync)場景的變化更大——過去需要 TTS、對嘴模型、後製混音的六步驟流程,如今一次 API 呼叫就能輸出人聲與嘴型同步的成片,因為嘴型與聲音本來就是同一次生成的產物。而在本地部署端,量化社群發布的精簡版本將權重壓到 42.5GB,ComfyUI 官方更表示搭配權重解除安裝後,12GB 視訊記憶體的消費級顯示卡即可執行。
「打趴」的另一面:三個保留項 不過,若要說 H3 已全面輾壓 Seedance,仍有三處必須誠實標註。其一,開源版只到 768p,招牌的 2K 輸出依賴未開源的 API 端上取樣模組,本地...
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力