0
| 本文作者: 袁毓婉 | 2026-08-04 17:22 | 專題:RSS:機器人,科學與系統會議 |
來源:RoboPaperHub
原文鏈接:https://mp.weixin.qq.com/s/gEEALnYbNF5phOmDpvfF_A
長時程操控里,單步動作預測易隨時間漂移,動作條件視頻模型又常因誤差累積或推理過慢難以閉環。RSS 2026多篇工作把世界模型接到策略鏈路:用中間視覺狀態穩住目標條件控制,或以可交互模擬器與想象推演支撐長視界訓練與自改進。
長時程操控不僅依賴部署階段的想象和規劃,也依賴預訓練階段是否學到了可遷移的動力學先驗。第一篇論文從數據攝入角度回答這個前置問題。
PAPER 01
一句話結論
行為克隆式機器人預訓練常丟棄異質具身數據中的動力學先驗。LDA-1B按數據質量分配策略、動力學與視覺預測目標,在結構化DINO潛空間共訓,使低質量軌跡與無動作視頻也能參與縮放。
創新點
1不同于把異質數據統一對待,高質量示范同時訓策略與動力學,低質量軌跡只用于動力學和視覺預測,無動作人類視頻專訓指令條件下的未來狀態預測。
2相對像素空間VAE,視覺預測改用預訓練DINO潛特征以減少冗余外觀建模;并用不對稱采樣的MM-DiT對齊3Hz視覺與10Hz動作流,支撐十億參數穩定訓練。
3匯總超3萬小時人機交互軌跡建成EI-30k,統一LeRobot格式并對齊末端坐標系,保留低質量數據并標注質量標簽,支撐質量感知共訓。
方法概括
模型在語言條件的多模態擴散變換器中聯合去噪動作塊與未來DINO特征,用任務嵌入切換策略、前向/逆向動力學與視覺預測,缺失模態由register token占位并按任務選擇性開損失。動作表示為手腕坐標系下的增量位姿與手指配置;視覺3Hz、動作10Hz。預訓練凍結VLM與DINO、更新MM-DiT與動作編解碼,后訓練直接吃混合質量遙操作數據做少樣本適配。
適用邊界
依賴固定DINO視覺特征,且觀測以自我中心相機為主,可能限制對新視覺視角與多模態信號的泛化。
英文原題
LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion
Jiangran Lyu、Kai Liu、Xuheng Zhang、Haoran Liao、Yusen Feng、Wenxuan Zhu、Tingrui Shen、Jiayi Chen 等 24 位作者
RSS 2026 · 2026-07-13
原文地址
https://roboticsconference.org/program/papers/210/
PAPER 02
一句話結論
現有目標條件策略多依賴單步動作預測,長時程易漂移。Act2Goal用目標條件世界模型生成中間視覺狀態,再以多尺度時序控制兼顧局部閉環與全局目標,支撐離線泛化與無獎勵在線自改進。
創新點
1相對把觀測與目標圖像直接映射為動作的GCP,引入目標條件世界模型,由當前觀測與目標生成中間視覺軌跡,顯式刻畫場景朝目標的演化。
2多尺度時序哈希將想象軌跡拆成稠密近端幀與對數稀疏遠端幀;部署時只執行近端動作,遠端作潛在引導,經交叉注意力接入動作專家。
3離線大規模模仿學習后,用事后經驗回放將自身rollout重標為目標達成軌跡,僅更新LoRA,實現無獎勵、無人工標注的在線自改進。
方法概括
給定當前多視角觀測與目標圖像,目標條件世界模型以流匹配在潛空間生成符合MSTH結構的中間視覺軌跡;動作DiT專家在機器人本體狀態與世界模型多尺度特征上做交叉注意力,按近端稠密、遠端稀疏輸出動作,部署時只執行近端。離線先聯合訓練視覺與動作流匹配,再端到端行為克隆強化動作;部署階段將達成狀態重標為新目標并僅微調LoRA,使策略在分鐘級交互中提升分布外成功率。
適用邊界
在線自改進依賴冷啟動:事后經驗回放假定初始策略已有部分能力或至少與目標物體有有效交互,不能從零學會訓練分布中完全缺失的新技能。
英文原題
Act2Goal: From World Model To General Goal-conditioned Policy
Pengfei Zhou、Liliang Chen、Shengcong Chen、Di Chen、Wenzhi Zhao、Rongjun Jin、Guanghui Ren、Jianlan Luo
RSS 2026 · 2026-07-13
原文地址
https://roboticsconference.org/program/papers/15/
PAPER 03
一句話結論
現有VLA把觀測直接映射成動作,缺少對物理過程的顯式建模,也常丟掉消歧所需的長歷史。Lingbot-VA把視頻與動作串成因果序列,先預測近未來視覺狀態再反推動作,支撐長時程與精細操控。
創新點
1用MoT把視頻與動作交錯進同一因果序列:大容量視頻專家預測未來潛變量,輕量動作專家再據此解碼控制量,把場景轉移與逐步動作推斷拆開建模。
2推理時把真實觀測與動作寫入KV緩存,按完整交互歷史條件生成,而不是固定短窗口或只信預測狀態,便于部分可觀測場景里做持久記憶與在線糾錯。
3訓練時對視頻歷史加噪,使動作專家能從半去噪潛變量讀出控制信號;部署時提前截斷視頻去噪步數,降低推理成本同時保持動作精度。
方法概括
系統先預測視覺世界如何演化,再由逆動力學從期望轉移解碼動作。架構上,Wan2.2初始化的視頻專家與窄寬度動作專家經MoT共享因果注意力:觀測經因果VAE壓成潛變量后,與對應高頻動作交錯成序列,塊內并行、塊間因果。訓練用teacher forcing聯合優化動力學與逆動力學流匹配損失,并對歷史視頻加噪,使動作可讀半去噪表示。部署時真實觀測寫入KV緩存閉環滾動,視頻去噪提前截斷、動作充分細化,兼顧長時記憶與控制頻率。
適用邊界
論文寫明:歷史感知策略可能過擬合數據動態、在強分布外(如人為打斷進度)性能下降;視頻骨干延遲高于無視頻預測的VLA;預訓練算力需求大。
英文原題
Causal World Modeling for Robot Control
Lin Li、Qihang Zhang、Yiming Luo、Shuai Yang、Ruilin Wang、Zhangluyao、Mingrui Yu、Zelin Gao 等 15 位作者
RSS 2026 · 2026-07-13
原文地址
https://roboticsconference.org/program/papers/16/
PAPER 04
一句話結論
動作條件視頻世界模型常因多步擴散過慢或長時程誤差累積,難支撐可擴展策略數據與可復現評估。Interactive World Simulator用中等規模真實交互數據訓練,在單卡RTX 4090上以15FPS穩定預測超10分鐘,使純模擬器數據訓練的模仿策略與同等真實數據表現相當,且仿真與真機評估強相關。
創新點
1圖像解碼與潛空間動力學均用一致性模型,先以CNN編碼器加一致性解碼器做高保真重建,再凍結自編碼器,用動作條件一致性模型做下一幀潛空間預測,兼顧多模態未來與交互速度。
2對上下文注入小噪聲并固定長度滑窗自回歸,使模型對噪聲上下文更魯棒;超出窗口丟棄舊潛變量,計算量不隨視界增長,支撐超10分鐘穩定交互。
3同一初始配置與采集協議下在模擬器收集等量專家數據,DP/ACT/π0/π0.5在模擬器與真實數據配比上任務分數相當,仿真與真機表現強正相關。
方法概括
以RGB觀測與動作為輸入,先把圖像編碼為緊湊2D潛變量并用一致性解碼器重建;再凍結自編碼器,在潛空間用3D卷積、FiLM與時空注意力的動作條件一致性模型預測下一幀,并滑窗自回歸解碼為視頻。人通過遙操作向模擬器發動作即可生成示范軌跡,也可讓策略與預測幀閉環交互做可復現評估。訓練約每任務600段、每段200步真實play數據,默認128×128。
英文原題
Interactive World Simulator for Robot Policy Training and Evaluation
Yixuan Wang、Rhythm Syed、Fangyu Wu、Mengchao Zhang、Aykut Onol、Jose Barreiros、Hooshang Nayyeri、Tony Dear 等 11 位作者
RSS 2026 · 2026-07-13
原文地址
https://roboticsconference.org/program/papers/18/
PAPER 05
一句話結論
真機在線強化學習受硬件成本、串行交互與人工復位限制。RISE把學習環境換成組合世界模型,在想象軌跡上估計優勢并更新策略,從而在接觸豐富與動態操作上獲得穩定自提升。
創新點
1組合世界模型把未來多視角狀態預測與進度價值評估分開建模,各自選用更合適的結構與目標,再由想象狀態差值得到動作塊優勢。
2動力學側在大規模機器人數據上以任務中心批處理預訓練并加輕量動作編碼器,優先同一場景下的動作多樣性,提高可控性與任務微調效率。
3自提升環在想象空間做在線推演:以最優優勢提示采樣動作,用動力學合成后續狀態并由價值模型評估,再混合離線數據做優勢條件化策略更新。
方法概括
RISE面向接觸豐富與動態真機操作,輸入多視角觀測與語言指令,輸出動作塊。先在離線示教、成敗回放與人工糾偏上對π0.5做優勢條件化熱身;再以組合世界模型交互——動力學模型預測動作條件下的未來多視角幀,價值模型用進度與TD目標評分并得到相對當前狀態的平均優勢。推演從離線初始狀態出發最多連續想象兩步,用評估優勢條件化更新策略并混入離線數據防遺忘;世界模型僅用于訓練。
適用邊界
世界模型精度與覆蓋仍約束效果,稀有或欠表征場景可產生物理不合理轉移;學習仍需相當比例真機數據錨定,想象與真機數據最優配比仍待厘清。
英文原題
Self-Improving Robot Policy with Compositional World Model
Jiazhi Yang、Kunyang Lin、Wencong Zhang、Jinwei Li、Tianwei Lin、Longyan Wu、Ya-Qin Zhang、Hao Zhao 等 14 位作者
RSS 2026 · 2026-07-13
原文地址
https://roboticsconference.org/program/papers/12/
本期判斷
1.多篇工作不再把觀測直接映射為動作,而是先建模場景演化或中間視覺狀態,再據此解碼控制,以緩解長時程漂移。
2.世界模型用途從單純視頻預測擴展到策略訓練、可復現評估與無獎勵自改進,成為長時程操控的訓練與評測載體。
3.質量分層動力學共訓、滑窗一致性交互與想象空間優勢更新,都在用有限真實數據把異質軌跡與仿真推演納入可縮放學習。
如果這份整理對你的研究或選題有幫助,歡迎收藏,也歡迎分享你的判斷。
具體技術細節與實驗結論請以論文原文為準。
本專題其他文章