精品免费99久久_色www精品视频在线观看_一区二区三区日韩精品视频_亚洲国产高清自拍

第一經(jīng)濟(jì)網(wǎng)歡迎您!
當(dāng)前位置:首頁(yè)>正文內(nèi)容

精彩看點(diǎn):物理AI等待的世界模型離大規(guī)模應(yīng)用還要多久

2026年,人工智能領(lǐng)域正在經(jīng)歷一場(chǎng)深刻的范式轉(zhuǎn)移。當(dāng)大語(yǔ)言模型將數(shù)字世界的文本處理能力推向極致之后,行業(yè)的共識(shí)已清晰指向下一個(gè)核心賽場(chǎng)——物理世界。


(資料圖片僅供參考)

AI不再滿足于屏幕內(nèi)的對(duì)話與生成,它開(kāi)始試圖“觸達(dá)實(shí)體世界”。英偉達(dá)CEO黃仁勛將這一浪潮稱為“物理AI”,在他看來(lái),世界模型正是實(shí)現(xiàn)物理AI的關(guān)鍵——能夠幫助AI理解物理世界的規(guī)律,從而實(shí)現(xiàn)機(jī)器人、自動(dòng)駕駛汽車(chē)等設(shè)備的自主操控。

(圖片來(lái)源:浙商證券)

也正是因?yàn)槭澜缒P蜐撛诘哪芰陀猛揪薮螅淠壳半x真正的可用尚有不少的距離和困境。

(圖片來(lái)源:浙商證券)

李飛飛在今年6月發(fā)表的長(zhǎng)文中試圖為這個(gè)混亂的局面建立一個(gè)分析框架。她把市面上的世界模型分為三類(lèi):渲染器只管“看起來(lái)像”,生成漂亮的像素和視頻,但不保證物理和幾何的正確性;模擬器追求結(jié)構(gòu)上的精確,輸出的不是畫(huà)面而是幾何數(shù)據(jù)、材質(zhì)參數(shù)、碰撞網(wǎng)格這類(lèi)信息;規(guī)劃器則負(fù)責(zé)在感知和行動(dòng)之間搭橋,讓智能體在行動(dòng)前能預(yù)判世界的變化。但這個(gè)分類(lèi)本身也說(shuō)明了問(wèn)題——如果連“世界模型是什么”都需要用一整篇長(zhǎng)文來(lái)厘清,說(shuō)明這個(gè)領(lǐng)域還遠(yuǎn)沒(méi)有走到技術(shù)收斂的階段。

王仲遠(yuǎn)則從另一個(gè)角度切入了這個(gè)問(wèn)題。他將當(dāng)前的技術(shù)路線分為四類(lèi):以語(yǔ)言為中心的世界模型(如VLA)、以像素為中心的世界模型(如視頻生成)、以三維結(jié)構(gòu)為中心的世界模型(如3D重建)、以視覺(jué)表征為中心的世界模型(如JEPA系列)。每一類(lèi)都自稱世界模型,但每一類(lèi)距離真正能理解、預(yù)測(cè)、交互真實(shí)物理世界的基座模型,都還有非常大的差距。這四類(lèi)路線都在各自的方向上推進(jìn),但它們之間不存在一個(gè)清晰的優(yōu)劣排序,更不存在一個(gè)公認(rèn)的“正確方向”。

數(shù)據(jù)的天塹:真實(shí)世界的燃料從哪里來(lái)

如果說(shuō)概念混亂是“不知道該往哪走”的問(wèn)題,那么數(shù)據(jù)匱乏就是“想走也沒(méi)路”的問(wèn)題。訓(xùn)練一個(gè)能理解物理世界的模型,需要的數(shù)據(jù)和訓(xùn)練大語(yǔ)言模型的數(shù)據(jù)完全是兩碼事。大語(yǔ)言模型可以從互聯(lián)網(wǎng)上抓取幾乎無(wú)限的文本——網(wǎng)頁(yè)、書(shū)籍、論文、論壇帖子,文本數(shù)據(jù)幾乎是免費(fèi)的。但物理世界的數(shù)據(jù)呢?一個(gè)杯子從桌邊掉下來(lái)會(huì)碎,人類(lèi)看一眼就懂,但要讓AI學(xué)會(huì)這個(gè)因果關(guān)系,需要的是帶有精確幾何、物理標(biāo)注、動(dòng)作標(biāo)簽的多模態(tài)交互數(shù)據(jù)。這種數(shù)據(jù)比互聯(lián)網(wǎng)視頻稀缺好幾個(gè)數(shù)量級(jí)。

更麻煩的是,即便有了數(shù)據(jù),也不一定是對(duì)的數(shù)據(jù)。王仲遠(yuǎn)坦言,真實(shí)物理世界的多模態(tài)交互數(shù)據(jù)極度匱乏,不同技術(shù)路線對(duì)數(shù)據(jù)的需求也各不相同。以具身智能為例,機(jī)器人在流水線上可以完成特定的任務(wù),但不具備泛化性和通用性——原因就在于缺乏對(duì)世界常識(shí)、物理規(guī)律的通用理解。目前世界模型的成功應(yīng)用仍然局限于自動(dòng)駕駛或電子游戲等特定領(lǐng)域,而這些領(lǐng)域的數(shù)據(jù)規(guī)模和多樣性,遠(yuǎn)遠(yuǎn)不足以支撐一個(gè)通用世界模型。

合成數(shù)據(jù)一度被視為解藥。用物理仿真引擎和游戲引擎生成大量虛擬數(shù)據(jù),成本遠(yuǎn)低于采集真實(shí)數(shù)據(jù)。但這條路也有自己的陷阱。各種物理仿真工具雖然可以對(duì)世界進(jìn)行模擬,但因?yàn)槿祟?lèi)掌握的真實(shí)物理知識(shí)、引擎規(guī)則和算法還不夠完備,仿真始終無(wú)法達(dá)到100%的真實(shí)。仿真環(huán)境里物體的運(yùn)動(dòng)規(guī)律跟真實(shí)世界之間一直存在差距——這就是業(yè)內(nèi)常說(shuō)的仿真到現(xiàn)實(shí)的鴻溝。AI生成的幾何體可能看起來(lái)沒(méi)問(wèn)題,但暗藏著面重疊、尺寸不對(duì)等缺陷,一旦送進(jìn)物理引擎計(jì)算,結(jié)果就會(huì)變得荒謬。用有缺陷的數(shù)據(jù)訓(xùn)練模型,模型學(xué)到的也只能是有缺陷的世界。

架構(gòu)的迷思:視頻生成、三維重建還是潛空間預(yù)測(cè)

在數(shù)據(jù)和概念之外,還有一個(gè)更深層的問(wèn)題:即便有了正確的數(shù)據(jù)、清晰的定義,我們也不知道該用什么架構(gòu)去構(gòu)建這個(gè)世界模型。這不僅是技術(shù)選擇的問(wèn)題,而是整個(gè)領(lǐng)域在根本假設(shè)上的分歧。

目前代表性的技術(shù)路線,如以谷歌的Genie3為代表的世界模擬器路線,創(chuàng)造出一個(gè)像電子游戲般、能根據(jù)用戶輸入實(shí)時(shí)演進(jìn)的交互式視頻環(huán)境。比如你一聲令下讓它“下雨”,整個(gè)世界就會(huì)動(dòng)態(tài)響應(yīng)。它的優(yōu)點(diǎn)在于畫(huà)面和用戶是雙向奔赴的,支持長(zhǎng)時(shí)間的連貫探索。但說(shuō)到底,其內(nèi)核還是基于視頻生成的邏輯,并沒(méi)真正掌握背后的物理因果

又如李飛飛World Labs團(tuán)隊(duì)——以三維結(jié)構(gòu)為中心,可以稱之為空間路線。他們的Marble模型能生成持久的、可下載的3D環(huán)境,用戶只需一句提示就能生成一個(gè)可導(dǎo)出的3D世界。但批評(píng)者指出,Marble看起來(lái)更像是一個(gè)3D渲染流水線,而不是機(jī)器人的大腦。它捕捉的是表面是什么樣子,并沒(méi)有內(nèi)置這個(gè)世界為什么會(huì)這樣運(yùn)”的物理規(guī)律。對(duì)于人類(lèi)來(lái)說(shuō),看到一個(gè)放在斜坡上的球就知道它會(huì)滾下來(lái);但機(jī)器人想做出同樣的判斷,還需要質(zhì)量、摩擦、速度這些信息。

還有則是認(rèn)知路線,以楊立昆主導(dǎo)的JEPA架構(gòu)為代表。它的核心思想是預(yù)測(cè)下一個(gè)表征,而非預(yù)測(cè)下一個(gè)數(shù)據(jù)。模型沒(méi)必要浪費(fèi)算力去生成像素,只需專注于捕捉那些能用于AI決策的世界狀態(tài)。這種路線在理論上更接近認(rèn)知科學(xué)中“心智模型”的概念——大腦并不存儲(chǔ)世界的每一個(gè)像素,而是存儲(chǔ)一個(gè)抽象的內(nèi)部表征,用來(lái)推理和預(yù)測(cè)。但這條路也遠(yuǎn)未成熟,從抽象表征到實(shí)際行動(dòng)之間還有漫長(zhǎng)的工程鴻溝。

世界模型離大規(guī)模應(yīng)用還有多遠(yuǎn)

世界模型離世界有多遠(yuǎn)?這個(gè)問(wèn)題沒(méi)有一個(gè)簡(jiǎn)單的數(shù)字答案。從概念的層面看,它離世界還隔著一層“定義之霧”——當(dāng)所有人都在用同一個(gè)詞說(shuō)不同的事,共識(shí)本身就遙不可及。從數(shù)據(jù)的層面看,它離世界還隔著一片“數(shù)據(jù)之海”——真實(shí)物理世界的交互數(shù)據(jù)稀缺到讓最樂(lè)觀的研究者也感到焦慮。從架構(gòu)的層面看,它離世界還隔著一道范式之墻——視頻生成、三維重建、潛空間預(yù)測(cè),每條路都有各自的理論支撐,也都有各自的致命短板。

智源研究院的判斷是,至少未來(lái)三到五年,都會(huì)是世界模型持續(xù)演進(jìn)迭代的階段。這個(gè)判斷既樂(lè)觀又克制——樂(lè)觀在于它相信方向是對(duì)的,克制在于它承認(rèn)時(shí)間不會(huì)太短。王仲遠(yuǎn)把世界模型比作深度學(xué)習(xí)的2012年前后——彼時(shí),數(shù)據(jù)孤島嚴(yán)重、路線未定、基準(zhǔn)還在打架,ChatGPT時(shí)刻尚未到來(lái)。

但世界模型面臨的挑戰(zhàn),可能比當(dāng)年的深度學(xué)習(xí)更深層。深度學(xué)習(xí)處理的是模式識(shí)別——從數(shù)據(jù)中找出統(tǒng)計(jì)規(guī)律。世界模型要處理的是因果推理——理解為什么物體會(huì)這樣運(yùn)動(dòng)、為什么事件會(huì)這樣發(fā)生。這兩種能力之間,隔著的可能不是幾年的技術(shù)迭代,而是某種根本性的認(rèn)知范式轉(zhuǎn)換。

而從長(zhǎng)遠(yuǎn)的視角看我們不必執(zhí)著于世界模型這個(gè)標(biāo)簽,也不必執(zhí)著于某一條特定的技術(shù)路線。真正重要的是,我們能否讓AI從“看起來(lái)像世界”走向“理解世界”,從像素級(jí)的模擬走向因果級(jí)的推理。

關(guān)鍵詞: 財(cái)經(jīng)頻道 財(cái)經(jīng)資訊

標(biāo)簽閱讀

上市企業(yè)

主站蜘蛛池模板: 国产精品免费久久久久久| 在线不卡日本| 欧洲久久久久久| 欧美日韩精品免费看| 隔壁老王国产在线精品| 久久精品五月婷婷| 热久久这里只有| 日韩欧美视频第二区| 91精品国产综合久久久久久蜜臀| 国产欧美日韩视频| 久久99精品久久久久久久青青日本| 日本不卡免费高清视频| 亚洲最大av在线| 91极品视频在线| www.欧美日本| 高清视频一区二区三区| 久久久久久伊人| 青青成人在线| 日本三级韩国三级久久| 日本免费高清一区| 欧美精品一区二区性色a v| 欧美在线欧美在线| 青青久久av北条麻妃黑人| 日韩手机在线观看视频| 91国产丝袜在线放| 91禁国产网站| 午夜精品一区二区在线观看| 亚洲a∨一区二区三区| 色播五月综合| 欧美日本在线视频中文字字幕| 日韩精品av一区二区三区| 亚洲高清视频一区| 日韩一区二区在线视频| 日本一区视频在线观看| 奇米一区二区三区四区久久| 久久中文字幕一区| 久久精品一本久久99精品| 国产在线精品91| 国产精品91久久久久久| 中文字幕日韩精品久久| 日韩在线视频免费观看|