精彩看點(diǎn):物理AI等待的世界模型離大規(guī)模應(yīng)用還要多久
2026-06-30 14:02:55 |來(lái)源:證券之星資訊
2026年,人工智能領(lǐng)域正在經(jīng)歷一場(chǎng)深刻的范式轉(zhuǎn)移。當(dāng)大語(yǔ)言模型將數(shù)字世界的文本處理能力推向極致之后,行業(yè)的共識(shí)已清晰指向下一個(gè)核心賽場(chǎng)——物理世界。
(資料圖片僅供參考)
AI不再滿足于屏幕內(nèi)的對(duì)話與生成,它開(kāi)始試圖“觸達(dá)實(shí)體世界”。英偉達(dá)CEO黃仁勛將這一浪潮稱為“物理AI”,在他看來(lái),世界模型正是實(shí)現(xiàn)物理AI的關(guān)鍵——能夠幫助AI理解物理世界的規(guī)律,從而實(shí)現(xiàn)機(jī)器人、自動(dòng)駕駛汽車(chē)等設(shè)備的自主操控。
(圖片來(lái)源:浙商證券)
也正是因?yàn)槭澜缒P蜐撛诘哪芰陀猛揪薮螅淠壳半x真正的可用尚有不少的距離和困境。
(圖片來(lái)源:浙商證券)
李飛飛在今年6月發(fā)表的長(zhǎng)文中試圖為這個(gè)混亂的局面建立一個(gè)分析框架。她把市面上的世界模型分為三類(lèi):渲染器只管“看起來(lái)像”,生成漂亮的像素和視頻,但不保證物理和幾何的正確性;模擬器追求結(jié)構(gòu)上的精確,輸出的不是畫(huà)面而是幾何數(shù)據(jù)、材質(zhì)參數(shù)、碰撞網(wǎng)格這類(lèi)信息;規(guī)劃器則負(fù)責(zé)在感知和行動(dòng)之間搭橋,讓智能體在行動(dòng)前能預(yù)判世界的變化。但這個(gè)分類(lèi)本身也說(shuō)明了問(wèn)題——如果連“世界模型是什么”都需要用一整篇長(zhǎng)文來(lái)
王仲遠(yuǎn)則從另一個(gè)角度切入了這個(gè)問(wèn)題。他將當(dāng)前的技術(shù)路線分為四類(lèi):以語(yǔ)言為中心的世界模型(如VLA)、以像素為中心的世界模型(如視頻生成)、以三維結(jié)構(gòu)為中心的世界模型(如3D重建)、以視覺(jué)表征為中心的世界模型(如JEPA系列)。每一類(lèi)都自稱世界模型,但每一類(lèi)距離真正能理解、預(yù)測(cè)、交互真實(shí)物理世界的基座模型,都還有非常大的差距。這四類(lèi)路線都在各自的方向上推進(jìn),但它們之間不存在一個(gè)清晰的優(yōu)劣排序,更不存在一個(gè)公認(rèn)的“正確方向”。
數(shù)據(jù)的天塹:真實(shí)世界的燃料從哪里來(lái)
如果說(shuō)概念混亂是“不知道該往哪走”的問(wèn)題,那么數(shù)據(jù)匱乏就是“想走也沒(méi)路”的問(wèn)題。訓(xùn)練一個(gè)能理解物理世界的模型,需要的數(shù)據(jù)和訓(xùn)練大語(yǔ)言模型的數(shù)據(jù)完全是兩碼事。大語(yǔ)言模型可以從互聯(lián)網(wǎng)上抓取幾乎無(wú)限的文本——網(wǎng)頁(yè)、書(shū)籍、論文、論壇帖子,文本數(shù)據(jù)幾乎是免費(fèi)的。但物理世界的數(shù)據(jù)呢?一個(gè)杯子從桌邊掉下來(lái)會(huì)碎,人類(lèi)看一眼就懂,但要讓AI學(xué)會(huì)這個(gè)因果關(guān)系,需要的是帶有精確幾何、物理標(biāo)注、動(dòng)作標(biāo)簽的多模態(tài)交互數(shù)據(jù)。這種數(shù)據(jù)比互聯(lián)網(wǎng)視頻稀缺好幾個(gè)數(shù)量級(jí)。
更麻煩的是,即便有了數(shù)據(jù),也不一定是對(duì)的數(shù)據(jù)。王仲遠(yuǎn)坦言,真實(shí)物理世界的多模態(tài)交互數(shù)據(jù)極度匱乏,不同技術(shù)路線對(duì)數(shù)據(jù)的需求也各不相同。以具身智能為例,機(jī)器人在流水線上可以完成特定的任務(wù),但不具備泛化性和通用性——原因就在于缺乏對(duì)世界常識(shí)、物理規(guī)律的通用理解。目前世界模型的成功應(yīng)用仍然局限于自動(dòng)駕駛或電子游戲等特定領(lǐng)域,而這些領(lǐng)域的數(shù)據(jù)規(guī)模和多樣性,遠(yuǎn)遠(yuǎn)不足以支撐一個(gè)通用世界模型。
合成數(shù)據(jù)一度被視為解藥。用物理仿真引擎和游戲引擎生成大量虛擬數(shù)據(jù),成本遠(yuǎn)低于采集真實(shí)數(shù)據(jù)。但這條路也有自己的陷阱。各種物理仿真工具雖然可以對(duì)世界進(jìn)行模擬,但因?yàn)槿祟?lèi)掌握的真實(shí)物理知識(shí)、引擎規(guī)則和算法還不夠完備,仿真始終無(wú)法達(dá)到100%的真實(shí)。仿真環(huán)境里物體的運(yùn)動(dòng)規(guī)律跟真實(shí)世界之間一直存在差距——這就是業(yè)內(nèi)常說(shuō)的仿真到現(xiàn)實(shí)的鴻溝。AI生成的幾何體可能看起來(lái)沒(méi)問(wèn)題,但暗藏著面重疊、尺寸不對(duì)等缺陷,一旦送進(jìn)物理引擎計(jì)算,結(jié)果就會(huì)變得荒謬。用有缺陷的數(shù)據(jù)訓(xùn)練模型,模型學(xué)到的也只能是有缺陷的世界。
架構(gòu)的迷思:視頻生成、三維重建還是潛空間預(yù)測(cè)
在數(shù)據(jù)和概念之外,還有一個(gè)更深層的問(wèn)題:即便有了正確的數(shù)據(jù)、清晰的定義,我們也不知道該用什么架構(gòu)去構(gòu)建這個(gè)世界模型。這不僅是技術(shù)選擇的問(wèn)題,而是整個(gè)領(lǐng)域在根本假設(shè)上的分歧。
目前代表性的技術(shù)路線,如以谷歌的Genie3為代表的世界模擬器路線,創(chuàng)造出一個(gè)像電子游戲般、能根據(jù)用戶輸入實(shí)時(shí)演進(jìn)的交互式視頻環(huán)境。比如你一聲令下讓它“下雨”,整個(gè)世界就會(huì)動(dòng)態(tài)響應(yīng)。它的優(yōu)點(diǎn)在于畫(huà)面和用戶是雙向奔赴的,支持長(zhǎng)時(shí)間的連貫探索。但說(shuō)到底,其內(nèi)核還是基于視頻生成的邏輯,并沒(méi)真正掌握背后的物理因果
又如李飛飛World Labs團(tuán)隊(duì)——以三維結(jié)構(gòu)為中心,可以稱之為空間路線。他們的Marble模型能生成持久的、可下載的3D環(huán)境,用戶只需一句提示就能生成一個(gè)可導(dǎo)出的3D世界。但批評(píng)者指出,Marble看起來(lái)更像是一個(gè)3D渲染流水線,而不是機(jī)器人的大腦。它捕捉的是表面是什么樣子,并沒(méi)有內(nèi)置這個(gè)世界為什么會(huì)這樣運(yùn)”的物理規(guī)律。對(duì)于人類(lèi)來(lái)說(shuō),看到一個(gè)放在斜坡上的球就知道它會(huì)滾下來(lái);但機(jī)器人想做出同樣的判斷,還需要質(zhì)量、摩擦、速度這些信息。
還有則是認(rèn)知路線,以楊立昆主導(dǎo)的JEPA架構(gòu)為代表。它的核心思想是預(yù)測(cè)下一個(gè)表征,而非預(yù)測(cè)下一個(gè)數(shù)據(jù)。模型沒(méi)必要浪費(fèi)算力去生成像素,只需專注于捕捉那些能用于AI決策的世界狀態(tài)。這種路線在理論上更接近認(rèn)知科學(xué)中“心智模型”的概念——大腦并不存儲(chǔ)世界的每一個(gè)像素,而是存儲(chǔ)一個(gè)抽象的內(nèi)部表征,用來(lái)推理和預(yù)測(cè)。但這條路也遠(yuǎn)未成熟,從抽象表征到實(shí)際行動(dòng)之間還有漫長(zhǎng)的工程鴻溝。
世界模型離大規(guī)模應(yīng)用還有多遠(yuǎn)
世界模型離世界有多遠(yuǎn)?這個(gè)問(wèn)題沒(méi)有一個(gè)簡(jiǎn)單的數(shù)字答案。從概念的層面看,它離世界還隔著一層“定義之霧”——當(dāng)所有人都在用同一個(gè)詞說(shuō)不同的事,共識(shí)本身就遙不可及。從數(shù)據(jù)的層面看,它離世界還隔著一片“數(shù)據(jù)之海”——真實(shí)物理世界的交互數(shù)據(jù)稀缺到讓最樂(lè)觀的研究者也感到焦慮。從架構(gòu)的層面看,它離世界還隔著一道范式之墻——視頻生成、三維重建、潛空間預(yù)測(cè),每條路都有各自的理論支撐,也都有各自的致命短板。
智源研究院的判斷是,至少未來(lái)三到五年,都會(huì)是世界模型持續(xù)演進(jìn)迭代的階段。這個(gè)判斷既樂(lè)觀又克制——樂(lè)觀在于它相信方向是對(duì)的,克制在于它承認(rèn)時(shí)間不會(huì)太短。王仲遠(yuǎn)把世界模型比作深度學(xué)習(xí)的2012年前后——彼時(shí),數(shù)據(jù)孤島嚴(yán)重、路線未定、基準(zhǔn)還在打架,ChatGPT時(shí)刻尚未到來(lái)。
但世界模型面臨的挑戰(zhàn),可能比當(dāng)年的深度學(xué)習(xí)更深層。深度學(xué)習(xí)處理的是模式識(shí)別——從數(shù)據(jù)中找出統(tǒng)計(jì)規(guī)律。世界模型要處理的是因果推理——理解為什么物體會(huì)這樣運(yùn)動(dòng)、為什么事件會(huì)這樣發(fā)生。這兩種能力之間,隔著的可能不是幾年的技術(shù)迭代,而是某種根本性的認(rèn)知范式轉(zhuǎn)換。
而從長(zhǎng)遠(yuǎn)的視角看我們不必執(zhí)著于世界模型這個(gè)標(biāo)簽,也不必執(zhí)著于某一條特定的技術(shù)路線。真正重要的是,我們能否讓AI從“看起來(lái)像世界”走向“理解世界”,從像素級(jí)的模擬走向因果級(jí)的推理。
關(guān)鍵詞: 財(cái)經(jīng)頻道 財(cái)經(jīng)資訊
標(biāo)簽閱讀
-
協(xié)鑫科技(03800.HK)6月30日耗資4225萬(wàn)港元回購(gòu)6000萬(wàn)股 快資訊
2026-06-30 -
消息!世大控股(08003.HK)2026財(cái)年業(yè)績(jī)扭虧 歸母凈利潤(rùn)2221.10萬(wàn)港元 營(yíng)收同比降23.84%
2026-06-30 -
法治在線丨這名外賣(mài)小哥 被民警點(diǎn)名表?yè)P(yáng)!
2026-06-30 -
簡(jiǎn)橙教育深度參與,“廣貨行天下 樂(lè)游廣州城”主題活動(dòng)正式啟動(dòng),打造文旅惠民新范式|最新資訊
2026-06-30 -
精彩看點(diǎn):物理AI等待的世界模型離大規(guī)模應(yīng)用還要多久
2026-06-30 -
贛州經(jīng)濟(jì)技術(shù)開(kāi)發(fā)區(qū)豆你玩手作店(個(gè)體工商戶)成立 注冊(cè)資本5萬(wàn)人民幣
2026-06-30 -
建業(yè)實(shí)業(yè)(00216.HK)發(fā)布年度業(yè)績(jī) 年內(nèi)虧損6.21億港元 同比收窄12.98%-觀點(diǎn)
2026-06-30 -
新股首日 | “穿刺手術(shù)機(jī)器人第一股”真健康醫(yī)療-B(02697.HK)首掛上市 早盤(pán)高開(kāi)159.27%
2026-06-30 -
6月30日生意社闊葉木漿基準(zhǔn)價(jià)為4450.00元/噸
2026-06-30 -
最新消息:華科智能投資(01140)發(fā)布年度業(yè)績(jī),股東應(yīng)占盈利61.72億港元 同比增加9519.74%
2026-06-30 -
美國(guó)3個(gè)月期國(guó)庫(kù)券需求降至2024年以來(lái)最弱水平_即時(shí)焦點(diǎn)
2026-06-30 -
CBOT農(nóng)產(chǎn)品期貨主力合約收盤(pán)全線下跌,玉米期貨跌2.89%-新資訊
2026-06-30 -
北京農(nóng)商銀行與京東集團(tuán)簽署全面戰(zhàn)略合作協(xié)議
2026-06-29 -
生意社氫氟酸(出口)6月29日均差繼續(xù)負(fù)向擴(kuò)大為-60.00元/噸
2026-06-29 -
觀焦點(diǎn):康緣藥業(yè):公司目前未持有GAP認(rèn)證基地
2026-06-29 -
盛達(dá)資源:上半年凈利潤(rùn)同比預(yù)增399.31%—470.64%|今頭條
2026-06-29 -
觀焦點(diǎn):友寶在線(02429)6月29日斥資73.02萬(wàn)港元回購(gòu)29.3萬(wàn)股
2026-06-29 -
【新要聞】農(nóng)行德興支行:一杯溫水暖廳堂,貼心服務(wù)獲稱贊
2026-06-29 -
研究:未來(lái)十年人工智能每年可為德國(guó)經(jīng)濟(jì)增長(zhǎng)貢獻(xiàn)0.2至0.7個(gè)百分點(diǎn)_每日信息
2026-06-29 -
【概念速遞】華亞智能新增“充電樁”概念
2026-06-29




