0
| 本文作者: 袁毓婉 | 2026-08-04 17:22 | 專題:RSS:機器人,科學與系統會議 |
來源:具身江河
原文鏈接:https://mp.weixin.qq.com/s/prlEip4pav6iyOtw95BIuw
傳統具身強化學習受限于真實世界交互成本高、復位繁瑣及安全隱患,難以高效提升VLA模型在復雜動態任務中的魯棒性。RISE框架通過構建解耦的“組合式世界模型”,將動力學預測與價值評估分離,實現了完全在想象空間中的高效在線強化學習。該方法避免了高昂的物理試錯,在傳送帶抓取、軟物打包和雙臂盒蓋等高難度任務中均取得了顯著的性能躍升,為具身智能策略的自主自進化開辟了可行路徑。
2*?, Kunyang Lin2*, Wencong Zhang2*, Jinwei Li2?*, Tianwei Lin?, Longyan Wu?, Ya-Qin Zhang?, Hao Zhao?, Ping Luo3, Zhizhong Su?, Hongyang Li3, Xiangyu Yue1?, Li Chen3?盡管模型容量與數據規模持續增長,視覺-語言-動作(VLA)模型在面對富接觸(contact-rich)與動態操控任務時依然表現脆弱,極小的執行偏差就可能累積為最終的失敗。強化學習(RL)雖能從根本上提升策略的魯棒性,但真實世界中的在線RL受到安全風險、硬件磨損以及環境復位成本高的嚴重制約。為了打破這一瓶頸,本文提出了RISE,一個基于想象的機器人強化學習可擴展框架。
RISE的核心在于構建了一個組合式世界模型(Compositional World Model):一方面利用可控動力學模型預測多視角未來圖像,另一方面利用進度價值模型對想象出的結果進行評價,從而為策略改進提供高質量的優勢(Advantage)信號。這種組合式設計允許動力學狀態與價值函數由最適合各自目標的獨立架構分別建模。這些組件被整合進一個閉環自進化管線中,無需昂貴的物理交互,即可在想象空間內連續生成想象軌跡(rollouts)、估計優勢信號并更新策略。在三項高難度的真實機器人操控任務中,RISE均大幅超越了現有方法,其中在動態傳送帶積木分揀任務中絕對成功率提升了35%,在背包打包任務中提升了45%,在雙臂盒蓋任務中提升了35%。
應用前景該技術不僅為通用機器人自主進化提供了新范式,在空天與遙感領域同樣展現出巨大的落地潛力。例如,在空間站特種機械臂抓取高速漂移廢棄物、無人機在復雜氣流環境中的無損軟著陸、遙感無人系統在災害現場復雜地形的自主避障與探索等任務中,RISE可以在合成的物理仿真與生成式想象環境中完成高風險試錯,大幅降低真實設備損耗與試錯風險。
當前VLA模型在具身操控中的核心短板在于應對動態環境和富接觸物理交互時的魯棒性不足。在實際操作中(如抓取移動物體、雙臂柔性物體協調等),機器人微小的位移偏差就會迅速累積成系統性失敗。模仿學習(IL)極度依賴專家示范的質量和覆蓋度,存在嚴重的分布偏移(exposure bias)問題,一旦脫離演示軌跡便難以自主糾錯。
基于真實物理世界的在線強化學習(Physical RL)雖然理論上能夠通過試錯學習糾錯技能,但面臨三大現實物理壁壘:硬件損耗高昂、串行交互極其耗時、以及需要大量人工監視與環境復位。這導致以往的真實世界RL方法大多局限于離線數據(Offline RL),存在嚴重的策略分布偏移。而在仿真器中訓練的方法又面臨不可避免的Sim-to-Real(仿真到真實)鴻溝。此外,現有的生成式世界模型雖然視覺生成質量高,但動作可控性差、生成推理速度慢(例如Cosmos模型合成25幀多視角預測需10分鐘以上),且缺乏長時程、高敏感度的中間獎勵評價信號,難以直接用于RL在線循環。
RISE提出了“在想象空間中進行在線強化學習”的思路,用高保真、高效率的生成式世界模型替代真實的物理環境。為了解決單一模型難以兼顧動力學預測與價值評估的問題,RISE設計了組合式世界模型:
RISE的核心設計邏輯在于“解耦”與“優勢驅動”。世界模型并非單一龐大的神經網絡,而是將“未來會變成怎樣(動力學)”與“這個狀態好不好(價值)”拆分為兩個解耦的模塊,分別采用最適合其目標的網絡架構與訓練目標進行獨立優化。

在組合式世界模型中,動力學模型利用快速視頻擴散模型架構,結合專門設計的任務中心批處理(Task-Centric Batching)策略。與傳統的混合任務批訓練不同,任務中心批處理在單個訓練批次中聚焦于同一場景下的多樣化動作探索,優先保障模型對不同動作指令的物理響應敏感度,從而大幅提升了動作可控性與泛化效率。

價值模型則直接利用預訓練VLA(如 )作為初始化骨干,繼承其豐富的具身先驗知識。為了解決單一進度損失對接觸失敗不敏感的問題,RISE創新性地結合了進度估計損失(Progress Loss)與時序差分損失(TD Loss):前者提供全局單調遞增的密化獎勵,后者通過引入成功與失敗軌跡的終端信號,大幅提高了對微小物理接觸失?。ㄈ缱ト』?、拉鏈未拉緊)的敏感度。

在自進化循環階段,策略首先在離線數據上進行預熱(Policy Warm-up),賦予其優勢條件生成能力。隨后進入“試錯-自我提升”迭代:交互策略以最高優勢提示(Advantage = +1.0)引導動作生成,動力學模型據此預測未來連續多幀圖像,價值模型對預測圖像進行離散化優勢評估,并將這些在想象空間中采樣的(狀態, 動作, 優勢)數據送入訓練緩沖區,對策略進行流匹配(Flow Matching)優化,實現閉環自主進化。

研究團隊在 AgileX 雙臂7自由度機器人平臺上針對三項極具挑戰性的真實操控任務進行了系統評估:傳送帶動態積木分揀(Dynamic Brick Sorting)、衣物打包(Backpack Packing)以及雙臂盒蓋(Box Closing)。評估指標包含終態成功率(Success Rate)與階段性過程得分(Score)。

實驗數據表明,RISE在所有任務上均大幅超越了包括 模仿學習基線、DAgger 交互式基線、PPO 在線強化學習、DSRL 以及離線 RL 方法 RECAP 在內的所有對照組。特別是在動態傳送帶分揀任務中,標準在線RL(PPO、DSRL)因為物理環境交互的不穩定性導致性能急劇衰減(成功率降至10%),而RISE達到了85%的成功率;在軟物打包和盒蓋任務中,RISE分別取得了85%和95%的極高成功率。

在動力學預測性能的定量對比中,RISE與當前主流的 Cosmos 和 Genie Envisioner (GE) 模型進行了評測。指標涵蓋圖像感知質量(PSNR, LPIPS, SSIM, FVD)以及反映運動光流預測精度的端點誤差(EPE)。

結果顯示,得益于任務中心批處理和針對性的動作編碼設計,RISE的動力學模型在運動端點誤差(EPE)上顯著低于 Cosmos 和基礎 GE 模型(例如在真實任務中 EPE 從 1.21/1.05 降至 0.54),這說明 RISE 能夠極高保真地模擬機器人動作引起的物體運動物理規律。

RISE框架成功證明了基于生成式世界模型的想象強化學習是突破真實機器人強化學習瓶頸的有效途徑。通過設計解耦的組合式世界模型,RISE兼顧了極高的動作預測控制精度、高效的推理速度以及敏感的密化價值評估,將原本極其耗時且高風險的物理試錯轉移至虛幻的想象空間中進行。該方法在不需要額外真實物理交互的前提下,實現了VLA策略在復雜動態與富接觸任務中的大幅自主進化。
在具身智能邁向大規模工業化與服務場景落地的過程中,RISE展現出重要的實用價值:
基于論文的討論,未來基于世界模型的機器人自進化方向可以在以下幾個方面繼續深耕:
本文內容為論文學習收獲分享,受限于知識能力,本文對原文的理解可能存在偏差,最終內容以原論文為準。本文信息旨在傳播和學術交流,其內容由作者負責,不代表本號觀點。文中作品文字、圖片等如涉及內容、版權和其他問題,請及時與我們聯系,我們將在第一時間回復并處理。
本專題其他文章