0
| 本文作者: 鄧哲敏 | 2026-08-07 14:09 | 專題:IJCAI:國際人工智能聯合會議 |

作者丨鄧哲敏
編輯丨齊鋮湧
大模型時代,規模化的數據能帶來能力躍遷,這一規律已被反復驗證。
當這套范式進入機器人領域,問題變得復雜。機器人需要的不僅是大量數據,而且是能夠轉化為動作能力的數據。
人類視頻近期成為研究者關注的新來源。它規模巨大、獲取成本低、覆蓋場景豐富,但它畢竟不是機器人數據,視頻里沒有機器人動作標簽,人類手部運動也無法直接對應機器人的控制信號。
問題由此產生:人類視頻進入機器人學習流程后,究竟應該被表示成什么?
過去一年,研究者給出了不同答案:有人把動作壓縮到隱空間,有人讓模型學習視頻背后的世界規律,也有人直接提取二維、三維軌跡。但這些路線究竟是彼此競爭,還是在解決同一個問題?
今年 IJCAI 2026 ,一篇來自清華大學、香港科技大學、微軟亞洲研究院等機構聯合推出的綜述論文,試圖重新梳理這一領域:不同方法的本質,都是在人類視頻與機器人動作之間搭建一座 representation bridge。
AI科技評論(雷峰網(公眾號:雷峰網)公眾號)采訪了論文一作、清華大學博士生、微軟亞洲研究院實習研究員馮志遠,拆解這篇論文背后的技術路線與行業判斷。


01
在語言模型快速發展的這幾年,一個隱性邏輯貫穿始終:數據規模決定能力上限。GPT能跑通,很大程度上因為互聯網文本是近乎無窮的訓練來源。自動駕駛的進步,背后也是持續積累的道路數據。
機器人的瓶頸就在于此。每一條訓練數據,都需要真實機器人執行一次動作,再把執行軌跡記錄下來。成本高、效率低,采集出來的數據還強耦合于特定硬件,換一款機器人,數據往往要重新收集。
Open X-Embodiment、DROID 這些大規模機器人數據集,放在機器學習的尺度上看,仍然算是小數據。
研究者漸漸把目光轉向人類視頻。
人類每天都在拿取、放置、開關、操作工具,而且這些行為被攝像頭大量記錄下來——YouTube上的教程視頻、頭戴相機拍攝的第一視角影像。HowTo100M 收錄超過 1.36 億個視頻片段,Ego4D 則積累了超過 3600 小時的第一視角視頻。數據獲取成本遠低于機器人演示數據,場景覆蓋也更加豐富。
馮志遠把這個優勢表達得很直接:戴一個智能眼鏡,出門隨便走走,所有人都能夠成為數據來源,并且成本非常低。人類視頻理論上可以從一萬小時的量級擴展到百萬、千萬小時。
但人類視頻不能直接喂給機器人。
論文里用了三點來描述這個困境:視頻里沒有機器人可以直接執行的動作標簽;沒有機器人的本體感知信息(關節角度、末端執行器狀態);人類手部運動和機器人的運動學控制接口根本不兼容。
這三重不兼容,構成了整篇論文要回答的核心問題:人類視頻進入訓練流程之后,到底應該變成什么?

02
論文的核心貢獻之一,是提出了一個統一的分類框架。
過去兩年里,各個團隊用不同方式讓機器人從人類視頻里學習,看起來像是各走各路。但論文的判斷是,它們本質上都在做同一件事:在人類視頻和機器人動作之間,選一個中間表示層,然后在那一層搭一座橋。
四條路線的區別,在于把橋墩打在哪里。

▎潛在動作:把動作壓縮進隱空間
這條路線的基本思路是,不直接標注動作,讓模型自己從視頻里“發現”動作。
LAPA(ICLR 2025)是這條路線的代表性工作,從人類視頻中學習出了可用于機器人控制的潛在動作表示。這個思路在 2024 年底到 2025 年上半年引發了大量跟進,一些后續 VLA 工作也借鑒了類似的無動作標簽學習思想。
它最大的問題是解釋性差。馮志遠把這個困境描述得很直接:“你的監督信號加在一個隱空間里面,中間訓到什么階段,只能看訓練loss。”論文里也明確指出,這條路線有一個懸而未決的開放問題:高度壓縮的離散 token,能否充分表示高自由度靈巧操作的豐富結構?
這條路線并沒有消退,相關工作仍在活躍推進,但工程落地上的驗證成本,讓它在某種程度上不如接下來要說的兩條路線直觀。
▎顯式 2D:在圖像平面上標出動作
如果說潛在動作是把監督信號壓進黑盒,顯式 2D 走的是另一個極端,直接在視頻畫面上提取可見的、可解釋的動作線索。
具體形式包括手部關鍵點坐標、物體的 bounding box、點軌跡,以及手部骨架的 2D pose 序列。這些信息可以用現有的視覺模型從視頻里提取出來,不需要額外的 3D 傳感器。
ATM 用密集點軌跡作為類動作監督信號,訓練模型預測未來運動;Magma 把這些軌跡渲染成“Trace-of-Mark”的視覺提示,直接嵌入到視頻畫面里作為訓練條件;Gemini Robotics 等工作也探索利用二維空間信息增強模型對動作位置和交互關系的理解。
2D 路線的局限也很明確:現實世界的操作本質上是三維的,2D 線索缺少深度信息,遮擋情況下容易失效。這條路線在論文里更多扮演輔助監督信號的角色,而非獨立的主路線。
▎顯式 3D:把手部軌跡還原到空間坐標
如果 2D 不夠,那就直接上 3D。這條路線試圖從人類視頻里恢復手部在三維空間中的完整運動軌跡,然后以此作為機器人的學習信號。
這里有一個核心的技術工具:MANO 模型,用相對低維的參數就能描述手的完整 3D 姿態。它充當了人類手部運動和機器人控制之間的“標準語言”,把人類視頻里的手部動作翻譯成機器人可以參照的三維坐標表示。
EgoVLA、H-RDT、Being-H0、VITRA 等工作都在這個框架下,不同程度地擴展了數據規模和覆蓋場景。
3D 路線的好處是對齊質量高,直接提供了機器人控制所需的坐標系表示。 但高質量的 3D 標注獲取成本也更高,野外視頻的 3D 重建精度不及 2D 監督,而且讓模型直接在 3D 空間預測動作,意味著它還需要從 2D 圖像中推斷出 3D 世界的結構,難度疊加。
在馮志遠看來,這條路線目前在 VLA 訓練里是 100% 需要的輔助監督——不是獨立的主路線,而是讓模型更準確感知空間的必要成分。
▎世界模型:先預測未來,再反推動作
這是目前最受關注、討論也最熱的一條路線。
世界模型的核心思路是:讓模型學會預測環境在未來會怎么變化,而不是直接預測動作。
GR-1 是這條路線的早期代表,在 Ego4D 的人類視頻上預訓練,學會根據語言指令和視覺觀測自回歸地預測未來幀,然后遷移到機器人數據上做動作預測。GR-2 在此基礎上大幅擴展了數據規模,使用 3800 萬條視頻片段進行預訓練,并在多項機器人操作任務上展示了較強表現。
這條路線在 2025 年至 2026 年間快速演進,出現了 WAM(World Action Model)這個新范式——在世界模型的感知骨干之上,再加一個 action expert 來解碼動作軌跡,類似于讓兩個專家分工:一個負責理解世界會如何變化,另一個負責把這個理解翻譯成機器人的具體動作。
這條路線的問題,馮志遠說得很坦率:效果現在沒有理論分析里那么強。論文里也指出了兩個具體的工程障礙:世界模型預訓練需要生成大量視覺 token,計算成本很高;而如何把世界模型里學到的知識有效蒸餾到動作預測,目前仍然是未被充分探索的問題。

03
這是這篇論文最值得提煉的一個判斷,也是它名為綜述卻不止于綜述的地方。
把四條路線排在一起看,會發現它們的本質差別只有一個維度:把監督信號加在哪一層?

用馮志遠的話說,這四種路線,本身都是一種監督的信號,或者說監督的表征。你可以把它們都當做是在人類視頻和機器人動作之間搭橋,只是選了不同的橋墩位置。
正因為本質是同一類東西,它們在實踐中可以疊加使用,而不是互斥競爭。在訓練世界模型的同時,完全可以把 3D 關鍵點軌跡作為輔助 loss 加進去;走 VLA 路線的系統,也可以同時用 2D 軌跡作為輔助監督任務。
目前業界認為比較合理的組合方式是,VLA 訓練中 3D 軌跡監督是必選項,2D 軌跡作為補充;世界模型路線則視情況疊加像素級或 latent 級的監督信號。
這個判斷對從業者很有價值。選擇路線,不是在選一個固定答案,而是在根據自己的數據、計算資源和任務特點,決定把監督信號打在哪一層。

在研究界,世界模型似乎是更受期待的方向。它的故事邏輯更自洽:天然適配大規模人類視頻、訓練范式成熟、逆向動力學比前向動力學的軌跡收斂更好。這也是目前許多具身智能創業公司在押注的方向。
但馮志遠對工業界現狀的描述是另一番圖景:“目前工業界更好的 demo,都是 VLA 加 RL 做出來的,但它并沒有真正做通具身 AGI 的那種泛化。”
這兩件事并不矛盾。VLA+RL 的組合,在有限場景里能做出漂亮的演示,但泛化性是它的短板。世界模型的泛化邏輯更完整,但目前效果沒有達到理論應有的水平。
馮志遠把這個差距歸結為 Recipe 未知。他說,語言模型收斂到了 Transformer + 大規模預訓練這套配方,視頻生成收斂到了 DiT,但機器人操縱還沒有。硬件層面的問題是真實存在的,但他認為模型本身的問題更大。
這也是為什么他對“具身智能的GPT-3.5時刻還有多遠”這個問題,給出的是一個偏保守的判斷:“可能還會很久。”

04
論文第五節列出了三個開放挑戰,是整篇論文最有沖擊力的部分之一。
▎第一個難題:怎么把零散視頻切割成有效的訓練片段。
YouTube 和 TikTok 上的視頻不是按照機器人學習需要的粒度錄制的。HowTo100M 里的教程視頻,旁白和實際操作動作的對齊很松散;Ego4D 這類第一視角視頻未經剪輯,包含大量視角切換和離題片段。
問題在于,同樣的視覺畫面過渡,可能對應完全不同的動作意圖,這種模糊性會破壞學習信號,尤其會讓潛在動作這類依賴離散化的方法產生噪聲。
目前的處理方式大多還是基于固定時間窗口的切割。論文指出,真正有效的做法應該是基于語義和交互狀態的分割——以操作階段和物體狀態變化為邊界,而不是以時間為邊界。
▎第二個難題:本體差異和視角差異同時存在,且很難同時解決。
本體差異指的是人手和機械臂的運動空間不兼容:人類高自由度的手部動作,映射到低自由度機械臂時是一個欠約束問題,有些人類動作根本無法被機器人實現,不同人類動作可能對應同一個機器人指令。
視角差異則是另一個層面的問題。機器人通常用固定的機器人中心視角(頭部相機加手腕相機),但網絡視頻以第三人稱視角為主。即使是 Ego4D、EPIC-KITCHENS 這類第一視角視頻,人在拍攝時會轉頭、手會遮住接觸點,和機器人固定安裝的相機視角仍然有本質差異。
論文認為,解決方案的方向可能是找到以交互結果為錨點的表示方式,比如物體狀態變化,而不是依賴視角相關的外觀特征。
▎第三個難題:現有評測基準可能根本不能預測真實部署效果。
這是最讓人警覺的一點。LIBERO、CALVIN、SIMPLER 這些常用的機器人操縱評測基準,任務設計的多樣性和長時程結構,遠不及真實人類視頻所涵蓋的范圍。結果是,在這些基準上刷出來的提升,可能是 benchmark 特有的,不能直接回答“人類視頻預訓練是否真正提升了泛化能力”這個根本問題。
論文建議的改進方向包括:評測應該追蹤在不同機器人數據預算下的遷移效率;量化視角變化和本體遷移下的魯棒性;在匹配的機器人數據量和計算預算下,對比有無人類視頻預訓練的效果差異等。
這三個挑戰,是這篇論文真正有貢獻的地方。相比給已有方法貼分類標簽,指出評測體系本身可能存在系統性偏差,需要更多的勇氣。

05
關于人類視頻的幾個判斷
論文之外,AI科技評論(雷峰網公眾號)圍繞人類視頻數據價值、技術路線選擇以及產業布局等問題,與馮志遠展開進一步交流。以下內容根據采訪原意整理。

▎AI科技評論:人類視頻規模巨大,未來是否會取代機器人真實數據?
馮志遠:我覺得不會取代,應該是兩個階段發揮不同作用。
人類數據最大的價值是泛化能力。因為它的數據量可以非常大,能夠覆蓋很多不同場景,這一點是真機數據很難做到的。
未來比較合理的訓練方式可能是,先用大量 human center data 做預訓練,讓模型學習比較通用的操作能力;然后再用機器人數據做 post training,讓模型適配具體機器人的本體。
機器人數據并不是沒有價值,而是它的角色會發生變化。以前機器人數據承擔了所有訓練任務,但未來它更多負責最后一步的本體匹配。
▎AI科技評論:人類視頻遷移到機器人,最大的技術鴻溝是什么?
馮志遠: 最大的問題其實還是本體差異。過去機器人很多是簡單夾爪,而人類視頻里面主要是人手,兩者之間存在很大的 mapping 問題。你需要把人的動作轉換成機器人的動作表示。
但未來隨著靈巧手發展,這個 gap 會逐漸縮小。比如現在很多機器人開始使用更接近人的手部結構,如果再結合頭戴式相機,讓機器人看到的視角和人類采集數據的視角越來越接近,那么從 human data 到 robot data 的轉換成本會降低。
所以未來可能不是完全解決 mapping,而是通過硬件設計讓 mapping 本身變得更簡單。
▎AI科技評論:在人類視頻驅動機器人學習的幾條路線中,你最看好哪一種?
馮志遠:我覺得世界模型這條路線在研究邏輯上更完整。
傳統 VLA(Vision-Language-Action)模型,本質上是從理解當前狀態出發,然后預測下一步應該執行什么動作。這更接近前向動力學。但問題是,從當前狀態到目標狀態,機器人其實可能有很多條不同的軌跡,比如抓一個蘋果,可以從不同方向、不同姿態完成。
世界模型的思路相反,它先預測未來環境會變成什么樣,再根據目標狀態反推出當前動作應該怎么執行。因為未來狀態已經被約束,反推出的動作軌跡可能會更加收斂。
另外一個優勢是,它天然適合利用大規模視頻數據。視頻生成是目前深度學習里相對成熟的方向,DiT(Diffusion Transformer)等方法已經證明了視頻模型可以進行大規模擴展。而人類視頻本身就是連續視覺變化的數據,不需要額外動作標注,就可以用于世界模型預訓練。
當然,現在 WAM 的實際效果還沒有達到理論預期。它的泛化能力目前仍然有限,而且世界模型預訓練需要生成大量視覺 token,計算成本非常高。另一個沒有完全解決的問題,是如何把世界模型學到的知識有效遷移到機器人動作預測上。
所以我看好它,更多是基于研究方向上的判斷,而不是說它已經在工程效果上全面領先。
▎AI科技評論:機器人從人類視頻中學習時,應該學習動作軌跡,還是背后的物理規律?
馮志遠:這個問題其實對應兩個不同階段。現在很多人會強調,機器人最終一定需要理解物理規律,比如物體之間怎么交互、力怎么傳遞、環境怎么變化。但我覺得從當前階段來看,優先級可能不是這樣。
如果把機器人的能力拆開看,學習軌跡帶來的收益會更直接。比如一個機器人要完成 pick and place(抓取放置)這樣的任務,首先需要知道手應該怎么移動、在哪里抓、怎么放,這些動作軌跡本身就是非常關鍵的信息。學軌跡可能可以把模型效果從四五十分提升到七八十分。
相比之下,進一步去建模背后的物理動態,比如摩擦力、接觸力、物體運動規律,更多是在模型能力已經達到比較高水平之后才需要解決的問題。比如人知道蘋果掉下來是因為重力作用,這種物理先驗其實已經被人類長期積累,不需要每次操作時顯式推理。
所以我覺得現階段,軌跡學習的收益會更高。當然,真正到了具身 AGI 的階段,物理規律一定是不可或缺的。但現在距離那個階段還有一段距離,優先把動作能力做出來更重要。
▎AI科技評論:微軟為什么選擇從 human-centric data 切入具身智能?
馮志遠:微軟亞研在具身這塊做了將近一年半了,范圍其實收得比較窄,主要還是用人類傳感器數據來做靈巧手操作,和導航、全身控制都沒什么關系。對外有 VITRA 這條線的開源工作。微軟目前沒有自己做任何具身硬件,靈巧手之類的本體就用別家的產品。整體更偏 research 性質,不是要下場做機器人,而是通過算法和開源去影響這個方向。
IJCAI 2026 要來了,你還在單打獨斗?
為了方便大家抱團交流、互通會議消息,我們專門建了 IJCAI 2026 參會群!進群你會解鎖這些「福利」?
會議情報站:投稿 DDL、格式規范、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。
同行茶話會:天南海北的同行都在群里,聊心得、碰思路、攢人脈,科研路上我們同行。
前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。
現場后援團:(會議期間專屬開啟):到了會場也不用慌——
路線導航:場館分布、報告廳怎么走,群里隨時問;
議題共讀:熱門 session、Keynote 現場探討,錯過也能追;
Poster 匯編:現場海報精華整理,一鍵收藏不遺漏;
約局廣場:約飯局、采訪局、交流局……想嘮嗑、想合作、想面基,群里發起就成。
? 進群傳送門: 掃碼進群或添加微信Qvv0909777,備注:IJCAI + 單位/學校+姓名+方向。

搞科研/搞技術,信息差很重要。
來,一起快人一步!


上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。