跳到主内容
@wquguru
精选70BlockTempo 动区(RSS)研究与分析

世界模型是什么?原理、巨头战局与争议解析

世界模型 World Model 是什麼?如何顛覆世界、運作原理、四大巨頭戰局與爭議

原文
发到 X

世界模型(World Model)讓 AI 建立「世界如何運作」的內部模型,理解空間、物理與因果,預測的是世界的下一個狀態,而不是像大型語言模型那樣只預測下一個字。它已在自駕車、機器人、遊戲場景落地,但畫面逼真不等於物理正確,與 LLM 誰才是通往 AGI 的正確路線,至今仍是業界最大的爭論之一。

(前情提要:李飛飛談 LLM 下一步:AI 須擁有「空間智慧」才能理解真實世界,Marble 模型如何實現?)

(背景補充:Serenity:世界模型成 AI 圈最大共識,中國資金棄基礎模型,轉為物理AI)

世界模型(World Model)是目前 AI 圈最常被提起、卻也最常被誤解的名詞之一。一句話定義:世界模型是一種讓 AI 建立「世界如何運作」內部模型的系統,讓它理解空間、物理與因果關係,並據此預測接下來會發生什麼。

它跟一般人熟悉的 ChatGPT、Claude 這類大型語言模型(LLM)不是同一條技術路線,LLM 預測的是「下一個字」,世界模型預測的是「世界的下一個狀態」。

世界模型是什麼?

世界模型(World Model),簡單來說就是讓 AI 學會「腦內模擬」的技術。舉個例子:人類過馬路前,會在腦中自動預演「如果我現在跨出去,那臺車還要幾秒到我面前」,這個預演不需要真的走到車前面試一次才知道結果。

世界模型想讓 AI 也具備這種能力,先在內部模擬各種可能,再決定下一步動作,而不是每次都要真實世界試錯。

史丹佛大學電腦科學教授、AI 領域指標人物李飛飛把世界模型的功能拆成三塊: 生成(generation)

理解(understanding)

模擬與互動(simulation/interaction)

她創辦的 World Labs,做的產品 Marble 主打的正是第三塊,模擬與互動,這被視為整條技術鏈裡最關鍵、也最難的一環,因為光是「生成一張漂亮的圖」不難,難的是生成一個「可以走進去、可以互動、物理邏輯還要合理」的空間。

這股風潮之所以在 2026 年集中爆發,一部分原因是產業界對 LLM 的天花板出現了明顯的焦慮。當「文字接龍」這條路線的天花板越來越清楚,一批研究者開始把賭注押到另一條路,讓 AI 直接學會理解「世界」本身,而不是只學會模仿人類怎麼描述世界。

值得先說清楚一個常見誤解:世界模型不是要取代 LLM 做對話或寫作,它解決的是完全不同的問題,空間推理、物理模擬、動作規劃。這也是為什麼它會先在自駕車、機器人、遊戲這幾個「需要理解物理世界」的領域率先落地,而不是聊天機器人。

世界模型和大型語言模型(LLM)差在哪?

大型語言模型(LLM)建立在 Transformer 架構上,運作方式是預測序列中「下一個 token(詞元)」。簡單來說就是,LLM 看過極大量的文字後,學會「這句話接下來最可能出現哪個字」,整個運算過程都發生在「文字空間」裡。

它從來沒有真正「看過」或「模擬過」物理世界,它內部沒有重力、沒有碰撞、沒有空間座標,只有文字之間的統計關係。

世界模型走的是另一條路。以 Yann LeCun 提出的 JEPA 為代表,它不去預測原始畫面的每一個畫素,也不預測文字 token,而是在「潛在空間」裡預測未來狀態的抽象表徵。

白話說就是,它會先把不重要的雜訊細節(例如背景牆上一道反光)主動丟掉,只保留理解這個世界所需要的核心資訊,這顆球正在往哪個方向滾、這輛車還要幾秒到路口。因為輸出是建立在一個明確、可檢驗的內部狀態上,一旦模型「內部想的」和「輸出的」對不上,這種不一致相對容易被偵測出來,這是 LLM 難以做到的。

兩者的差異,可以用下表快速對照: 比較專案 大型語言模型(LLM)

世界模型(World Model)

預測目標 下一個 token(文字)

世界的下一個狀態 運作空間 文字 / 語言空間 潛在空間(latent space)

核心架構 Transformer JEPA、擴散模型、自迴歸 Transformer 等 是否理解物理 不模擬物理,無內部世界模型 學習物體移動、碰撞、重力等物理規律 典型錯誤 幻覺(多數模型仍在 15% 以上)

畫面逼真但物理不一定正確 代表應用 對話、寫作、程式碼生成 自駕模擬、機器人訓練、可探索 3D 世界 要提醒的一點是:「畫面看起來逼真」不等於「物理上是對的」。以影片生成為基礎的世界模型,因為訓練目標更直接對準「看起來真不真」,不一定會保證「物理上合不合理」,這在自駕車、機器人這種容錯率極低的場景裡,是個關鍵的區別,也是接下來爭議的核心之一。

世界模型怎麼運作?潛在空間與「預測下一刻」

要理解世界模型的運作邏輯,得先搞懂兩個詞:潛在空間和預測下一刻。

潛在空間,簡單來說就是,AI 把眼前看到的畫面「壓縮」成一組抽象數字,只留下對理解這個世界有用的資訊,丟掉多餘的視覺雜訊。

舉個例子:一段行車紀錄器畫面裡,潛在空間可能只保留「前方有一輛車,距離在縮短,速度中等」這樣的抽象描述,而不去記錄畫面裡每一片樹葉的顏色。這樣做的好處是運算量大幅降低,而且模型學到的是「規律」而不是死記畫面。

有了潛在空間,下一步就是「預測下一刻」:給定目前的狀態,加上一個動作(例如方向盤往左打),模型要預測下一個狀態會長什麼樣子。

這個過程反覆疊代,就變成一個可以「往前推演」的內部模擬器,給 AI 一個當下,它能在腦內先跑過幾種可能的未來,再決定要採取哪個動作,而不必真的去現實世界裡撞一次才知道結果。

JEPA(Joint Embedding Predictive Architecture,聯合嵌入預測架構)是這套邏輯目前最具代表性的架構,由 Yang LeCun 在 2022 年的論文《A Path Towards Autonomous Machine Intelligence》中提出。

JEPA 的核心主張是:與其逼著模型生成每一個畫素的細節(這樣做既浪費算力、又容易被無關緊要的雜訊帶偏),不如直接在抽象層次上比對「預測的未來」和「實際的未來」是否一致...

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近