0
| 本文作者: 鄧哲敏 | 2026-08-06 18:42 |

作者丨鄧哲敏
編輯丨齊鋮湧
今年視頻生成和具身智能領域,陣容最為豪華的一篇“融合體論文”出現了。
前幾天,一篇名叫Masked Visual Actions for Unified World Modeling的論文,掛在 arxiv 上,這篇工作還未在學術圈傳開,但絕對馬上就要爆了。
因為它的署名欄和論文內容都實在太炸裂了,大家自己看吧。

不僅包括李飛飛,ImageNet 締造者,如今全力押注空間智能;吳佳俊,斯坦福助理教授,物理推理方向代表人物,剛獲得熱乎的 IJCAI 2026 計算機與思維獎,還沒領獎;張呂民,ControlNet 作者,如果你用過 AI 繪畫里照著姿勢生成人物的功能,你已經在用他的技術。
還有斯坦福計算成像實驗室負責人 Gordon Wetzstein、機器人基礎模型核心推動者黃文龍等十多位頂尖學者。
更讓AI科技評論(雷峰網(公眾號:雷峰網)公眾號)意外的是哈佛助理教授 Yilun Du,也在其中。
因為大家可能知道,他和李飛飛,恰好是具身智能領域兩條路線的代表人物。一個主張讓 AI 直接在看得懂的畫面里思考,一個主張把一切先壓縮成抽象數字再思考,學術交集極少,上次合作還是五年前杜在 MIT 讀博,之后一直觀點分野,這次同署,本身就是看點。
要知道,學術圈里,某些名字湊在一起就是信號。兩條路子平時互不相讓,這次卻出現在同一篇論文里。
只能說這篇工作,可能找到了兩條路線都認賬的交叉點,或者叫做共識?
機器人,也許根本不需要自己專屬的大模型。
這個“共識”有些可怕,現在多少大廠拼命卷機器人大腦基模,多少創(chuàng)業(yè)公司靠一個基模撐起了幾十億估值,但這篇論文,在挑戰(zhàn)這一認知。
按論文的結論,也許機器人不僅不需要自己的專屬大模型,甚至不需要重訓已有的視頻生成模型,只需要找對接口,就完全可以直接利用日趨成熟的視頻生成模型。
同時,這篇論文對產業(yè)界的影響也是巨大的,它的思路一旦走通,那么今后各個工廠或者快遞分揀站“換條機械臂就宕機”的跨本體難題,將得到徹底解決。
好了,說太多了,開始解讀一下。

01
總結來看,這篇論文可以概括出一句話:過去視頻模型懂物理但不懂動作,是因為缺一個"翻譯接口",如今通過 MVA 把動作變成像素遮罩軌跡即可完成翻譯,同時,MVA 模型能同時做正向(世界模擬)和逆向(動作生成)。在僅用 15 小時數據微調情況下,就能讓機器人操作,從單臂泛化到未見過的雙臂上。
解讀論文前,先通過一個小例子來解釋一下行業(yè)痛點。
如果一個人廣泛瀏覽物理紀錄片、慢動作回放和日常視頻,一定會練出一種物理直覺:球滾到桌邊,多半會掉;水杯被撞,水會灑。這種直覺不是背出來的,是看多了自然長出來的。
今天的視頻生成模型,差不多就是這樣一個人。
無論 Sora 還是國內宇宙廠、老鐵廠、生數或其他開源模型,吞下海量視頻后,也練出了類似的物理直覺。給它一段拿起水壺傾斜的開頭,它能續(xù)出一個大致靠譜的后續(xù):水壺里的水會被倒進杯子里。沒人教過它牛頓定律,它全靠看出來的。
但它有個致命問題:從沒親手做過任何事。你把機械臂放在它面前,讓它把杯子挪到左邊,它會愣住,因為完全不懂往左挪這句話該怎么變成給電機的信號。
這篇論文前言基于這些分析,直接指出一件重要的事:
當下視頻模型懂物理,但不會下達指令。
馬上論文給出答案說:問題出在了“翻譯”上。
很多人看到這里估計懂了,這里講的翻譯,其實指的是視頻模型看懂以后,該以什么方式傳遞指令。
其實機器人的世界講的是一套很干巴的語言,關節(jié)轉了多少度,末端移動了多少厘米,夾爪合攏到什么程度。這套語言跟視頻模型腦子里那套“像素怎么流動、顏色怎么變化”的語言完全對不上。
這就好比你請了一位見多識廣的美食評委,但你沒法直接和他聊菜譜,只能用摩爾斯電碼敲給他。他心里門兒清這道菜該怎么做,可你敲的那串點和劃他完全看不懂。
過去幾年,研究者們試過不少辦法彌合這道溝。

論文直接拿一些經典工作出來舉例,提到被譽為機器人策略開山之作的 UniPi ,雖然能做到用文本引導視頻生成規(guī)劃,但文字指令太模糊,動作精度始終受限于語言描述;
此外,又舉例 cmu 和 Meta 合作的經典工作 Track2Act ,能在畫面上標軌跡點,用點軌跡預測做操作,但稀疏的點描述不清一個連續(xù)動作;
還有另一個思路,也就是 Ctrl-world ,它是把機器人的關節(jié)角度直接喂給模型,最直接,卻也最脆弱,因為換一款機械臂,同樣的“關節(jié) 1 轉 30 度”意味著完全不同的姿態(tài),模型立刻懵掉。
這些方案的共同思路是逼著視頻模型去學一門它本不熟悉的外語。
而這篇論文換了個問法:為什么不干脆用視頻模型自己的母語跟它說話?

02

整套方法出乎意料地樸素,拆開看其實就三步。
▎第一步:把動作變成一段涂了顏色的錄像
這篇論文提到,他們用了一個叫 SAM 的工具,全稱 Segment Anything Model,是 Meta 做的摳圖模型,是目前視覺圈最好用的通用摳輪廓工具之一。
SAM 把視頻里的機器人和操作物體從畫面中分割出來,得到它們在每一幀中的區(qū)域(mask)。
由于機器人和物體都在不斷運動,這些區(qū)域隨著時間連續(xù)變化,自然就形成了兩條運動軌跡:一條記錄機器人是如何移動的,另一條記錄物體是如何變化的。
這就是這篇論文(MVA)對動作的全部定義。沒有角度,沒有坐標,沒有數字,只有色塊在畫面里怎么游走,就這么簡單。
▎第二步:遮住一條軌跡,讓模型自己把它補出來
這一步是整篇論文真正的巧思。
把物體運動的軌跡遮住,只留機械臂運動軌跡,再把這段缺了一半的錄像交給 AI,問它接下來會發(fā)生什么?
AI 盯著機械臂的運動軌跡一推演:手臂這樣伸過去、這樣一推,那個被藏起來的物體接下來會往哪兒移動、會不會被碰倒。
反之,把機械臂遮住,AI 看到一個杯子從桌子左邊滑到右邊,卻看不到是誰推的。它必須反過來推理機械臂應該怎么伸、怎么動。
這時你可能發(fā)現了,前者 AI 扮演的是世界模擬器:給定機器怎么動,推演世界會如何變化。后者AI 扮演的是動作生成器:給定世界該如何變化,反推出機器應該怎么行動。
這個巧思最妙的是,完成這兩項任務的始終是同一個模型、同一套參數,沒有任何切換開關。它是在模擬世界還是在生成動作,只取決于你遮住哪條顏色。
這讓我們想到有點像做完形填空,同一篇文章,這次挖空動詞,下次挖空名詞,考察的是同一個腦子的不同能力。
▎第三步:不需要從頭訓模型,只用15小時就能教會機器人
MVA 沒有從零訓練任何東西,它站在了一個現成模型的肩膀上:阿里的開源視頻生成模型 Wan2.2 。Wan2.2 有 140億 參數,基于擴散 Transformer 架構,是目前開源陣營里生成質量最能打的選手之一(但非常可惜,據AI科技評論最新消息,Wan 團隊已經解散)。
這套組合里,Wan2.2 相當于那個看過一萬部紀錄片的“人”,物理直覺已經練得相當到位了。MVA僅僅用 LoRA(Low-Rank Adaptation,一種很省力的微調手段),就讓 Wan2.2 能看懂剛才機器人語言體系中涂抹色塊。
之所以不去動大腦本身,僅用現成模型搭建,是因為大動干戈地全面重訓,不僅花錢費力,還很容易把原本積累的物理直覺沖洗掉。就像一個物理學家被拉回去重刷三年小學數學題,搞不好反而把微積分忘了。
對比一下就出來了,別人都花幾個億從零開始訓基座模型,外加堆幾千幾萬小時機器人操作數據,才勉強讓機器人學會動作。
而 MVA 的思路,是 0 元購現成的開源模型 + 15 小時數據,就直接讓機器人實現 zero-shot 泛化效果,有點離大譜了。

03
方法講完了,效果怎么樣?用論文里兩組數字總結一下。
第一組:同款機器人上的碾壓式領先。用一個衡量生成畫面和真實畫面差多遠的指標 LPIPS 來看(數值越低越好),MVA 跑出的成績是 0.0945,而排第二的對比方法 Ctrl-World 是 0.362,差了將近四倍。
那些完全不告訴模型該怎么動的純視頻生成方法,幾乎全線崩潰,畢竟連指令都沒給,模型自然無從預測未來。

第二組:換一臺完全沒見過的機械臂,照樣能用。
研究者訓練時用的是一款單臂機器人的數據,測試時突然換上一款訓練階段從沒出現過的雙臂機器人。結果,Ctrl-World 當場失靈,而 MVA 照樣輸出了靠譜的預測。

基于這套能力,論文還順手演示了三種用法。
第一,給現有策略打分:讓機器人先在腦子里把幾種候選動作各自演一遍,挑結果最靠譜的,再真去執(zhí)行。
第二,當規(guī)劃器用:不需要訓練任何專門的策略網絡,靠反復想象-篩選就能規(guī)劃出一條可行路徑。
第三,反推動作:只需要告訴它任務,它就能推演出機械臂該怎么配合完成。

04
以上是從學術角度的拆解。
但當AI科技評論(雷峰網公眾號)和一位常年在機器人一線做產品的技術負責人李琳鑫討論這篇論文時,他幾乎沒怎么在意前面講的完形填空設計有多巧妙。
琳鑫是深圳韋特嘉機器人 CTO、聯創(chuàng),一直在做世界模型、AI 視覺與泛化三維重建在物流倉儲的落地工作。
他的第一句判斷,就把重心移到了別處:“這篇文章的核心不在于模型訓得好,而在于泛化性的增強。以前大家沒有辦法解決這種異構機械手的一個識別,或者說叫遷移。它解決了這個問題。”
學術論文愛講“我的方法有多新”,但產業(yè)界真正關心的是“這東西解決了什么痛點”。
接著,李琳鑫提到了一個重要的細節(jié),是論文里關于“直接輸出還是間接輸出”的分野。
他的說法比我們前面的比喻還要直白:“大多數面向實機部署的 VLA 策略,輸出的是與特定本體綁定的低層動作表征(不管是關節(jié)角、末端增量還是關節(jié)速度)。換一臺運動學結構不同的機器,這套輸出就失效了。這個做的是,先理解環(huán)境,再做 IK 去解算出來各個軸的。中間多加了一層,就導致泛化性極強,跟我們現在在做的思路是基本上一樣的。”
別人都是圖像進、帶角度的數據出,換臺機器角度就對不上了;MVA 多加了一層,先想清楚手該去哪,再用 IK 算出各關節(jié)怎么配合。就這一層中轉,讓泛化能力直接上了一個臺階。
其實他提到的,是論文在用好幾頁篇幅說的另一個重點:URDF 。
這個細節(jié)學術界不太關注,但在產業(yè)界看來,卻是決定這套方法能不能跨本體泛化的關鍵。
論文有張很清晰的流程圖,細看會發(fā)現色塊的生成遠比想象中講究。第一步用 SAM 認出機械臂輪廓,第二步,研究者導入了這臺機械臂的 URDF 文件。

URDF(Unified Robot Description Format)是機器人行業(yè)通用的一份“說明書”,記錄著一臺機械臂有幾個關節(jié)、每個關節(jié)能轉多大角度、連桿有多長、轉動起來末端會落到哪里。差不多每一款商用機械臂,都會附帶自己的 URDF 文件。
有了這份說明書,兩件重要的事就變得可以計算了。
一件叫正運動學(FK):已知每個關節(jié)轉了多少度,反推末端在空間里的位置。這就像你閉著眼睛也能感覺到,肩膀轉了多少、手肘彎了多少,你的指尖大概停在什么地方,你的大腦天生就在做這種計算。
另一件叫逆運動學(IK),方向反過來:已知你想讓末端到達某個位置,反推每個關節(jié)該轉多少度才能湊出這個姿勢。你想夠到桌上那只杯子,大腦瞬間就算出肩膀和手肘該怎么配合,你自己甚至意識不到這中間發(fā)生了計算。

這里浮現出一個關鍵分岔。
市面上大多數讓機器人學會動作的模型,做法是直接吐出關節(jié)該轉多少度,圖像進去,一串角度數字出來,中間沒有任何中轉。這個辦法簡單粗暴,但脆弱得不堪一擊:同樣一句“關節(jié) 1 轉 30 度”,在一臺六軸機械臂和一臺七軸機械臂上,擺出來的姿勢可能完全不是一回事。就像你對一群身高體重各不相同的人喊“左臂抬高 30 度”,每個人抬出來的姿勢也會天差地別,因為大家的骨架不一樣。
而 MVA 走了另一條路:它先想清楚末端應該到什么地方去,再借著這臺機器自己的 URDF 說明書,通過逆運動學反算出這臺特定機器該怎么擺關節(jié)。
指令通用了,執(zhí)行方式各自適配。這一層看似多余的中轉,恰恰是它能夠換機型不換腦子的真正原因。
URDF 還能偷偷干另一件事:把視頻生成的多余想象力摁住了。
視頻模型天馬行空,有時候會一本正經地生成一個物理上根本擺不出來的詭異姿勢。有了 URDF 描述的運動學限制,模型生成的每一個姿勢都必須是這臺機器真實能擺出來的,給想象力劃定邊界,畫面反而變得更可信了。
這就是為什么李琳鑫作為產業(yè)界人士,這么關注URDF 的原因了。
此外,從他的視角,還把這篇論文放進了更大的行業(yè)動向里:“從今年上半年大家都做分層架構了,核心就是想把 vision 和 action 給拆開……它沒有必要和 video 去結合,因為 video 的部分有 VLM 去做整體的識別、分割和處理。這個數據量一定比大家結合素材去做的數據量大非常非常多,完全不是一個量級。"
這個一點感受和我們是相似的。具身今年的行業(yè)趨勢是把看和動拆開。
看的部分用互聯網海量視頻訓練,數據量是機器人實機數據的成千上萬倍;動的部分用相對少的機器人數據加運動學計算補齊。這篇論文正好卡在這個趨勢的接口上。
有意思的是,李琳鑫團隊走的其實是另一條路:受 Yann LeCun 影響的隱空間世界模型路線。但談起和這篇論文的關系,他說:“我們核心的點也是在 URDF 的導入和 IK/FK 的解算上。這個點上大家是可以結合的,思路上甚至一定程度是相通的。”
兩條看似分道揚鑣的技術路線,底層都繞不開同一份 URDF 說明書,都得算同一套正逆運動學。路線之爭走到足夠深處,答案未必是二選一。

05
MVA 試圖證明,機器人不需要一套專屬的動作語言,只要找準一個接口,把動作翻譯成視頻模型早就懂的那套像素語言。
這個想法背后藏著一層很深的判斷:具身智能往前走的路,或許不在于把機器人專屬的模型越練越大,而在于想辦法把已經很強的視覺大模型直接借過來用。互聯網上的視頻幾乎是無窮無盡的,而機器人真機操作的數據永遠稀缺又昂貴。誰能讓機器人真的吃下前一種數據,誰手里握的籌碼就完全不一樣。
說到底就是一句話:最好的翻譯,不是逼著對方學你的話,而是用他早就聽得懂的話,去說你真正想說的事。當學術圈最有分量的一批人,和產業(yè)界正在悄悄發(fā)生的架構變化,不約而同地指向了同一個方向。
這條路,值得再多看幾眼。
本文技術顧問
【李琳鑫:韋特嘉機器人 CTO &聯創(chuàng);研究方向:世界模型 + AI視覺+泛化三維重建】


上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區(qū)。
雷峰網原創(chuàng)文章,未經授權禁止轉載。詳情見轉載須知。