跳到主内容
@wquguru
精选70BlockTempo 动区(RSS)研究与分析多源精选 ×4

英伟达开发Nemotron 4开源模型,参数或达1万亿

輝達開源大進擊:Nemotron 4 上看 1 兆規模,迎戰中國模型

原文
发到 X

輝達傳正開發新開源模型 Nemotron 4,最大版本參數估至少 1 兆,劍指中國開源陣營。同日並發表 Nemotron 3.5 Lightning 與 NeMo Switchyard。

(前情提要:Nvidia 推出 Nemotron 3.5 Lightning 開源 AI 模型,單一 GPU 即可執行 AI 代理)

(背景補充:OpenRouter:中美 AI 差距只有 3~6 個月,開源模型正席捲世界)

根據 The Information 報導,輝達(Nvidia)正在開發新一代模型家族 Nemotron 4,最大版本參數量預估至少 1 兆,目標是正面對上全球頂尖的開源模型。

同一天,輝達還發表了新款 Nemotron 3.5 Lightning,並發布開源路由工具 NeMo Switchyard,一邊擴軍、一邊布局基礎設施,攻守同時進行。

這場軍備競賽,輝達遲到了?

The Information 報導引述多名參與專案的員工指出,Nemotron 4 尚未完成最終訓練,輝達也還沒訂出正式發表日期,但最快可能在今年秋末準備就緒。輝達尚未回覆路透社的置評請求。

在一眾以閉源為主的美國實驗室裡,輝達算是少數持續推出開源模型的大型企業之一。去年底,隨著中國 AI 實驗室的產品迅速湧現,輝達推出了第 3 代開源模型家族 Nemotron 3。

依規模分成三個尺寸:Nano 總參數約 300 億、單次最多啟用 30 億;Super 總參數約 1,000 億、單次最多啟用 100 億;Ultra 總參數約 5,000 億、單次最多啟用 500 億。

這三款用的都是混合專家架構(MoE),簡單來說就是,模型內部養了一群專家,每次推論只按需求叫醒其中一小部分,不必整個模型全體出動,藉此用更少的運算成本撐起更大的參數規模。

這次的 Nemotron 4,最大版本參數量預估至少 1 兆,把規模直接翻倍。

誰在逼輝達動作?

輝達生成式 AI 副總裁 Kari Briski 對此表示,輝達投資 Nemotron,是因為相信每一家公司、每一個國家都需要可取得的前沿開放模型,以強化安全、加速創新,並提供一個可以跨世代依賴的基礎。

白話說就是,如果輝達不站出來做這件事,主導權可能就落到別人手上。

而這裡的別人,指的正是中國開源陣營。DeepSeek 今年 4 月發布的 V4 預覽版,其中 V4-Pro 總參數已達 1.6 兆、單次啟用 490 億,較輕量的 V4-Flash 總參數也有 2,840 億、單次啟用 130 億。

阿里巴巴的 Qwen 系列連續兩年是全球下載量最高的模型系列,累計下載已超越 Meta 的 Llama;月之暗面的 Kimi K3 也展現出接近美國企業頂尖模型的高性能,但價格更划算。

1 兆 vs 1.6 兆,輝達訓練的 Nemotron 4 論規模其實已經落後一截這場仗,目前更像是追趕者。

不過參數量從來不是唯一的戰場。論文寫得再漂亮,能不能把模型變成好用的產品,才是輝達真正在乎的事;從 Nano 到 Ultra,再到規模翻倍的 Nemotron 4,輝達要證明的,是自己有能力把「夠大」的模型迅速轉換成「能用」的模型,而不只是在參數列上跟中國陣營比大小。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源
英伟达开发Nemotron 4开源AI模型
ChainCatcher 链捕手(Telegram)原文
英伟达开发新Nemotron 4开源AI模型
律动 BlockBeats(Telegram)原文

相似阅读

另一事件,读法相近