0
| 本文作者: 陳淑瑜 | 2026-07-21 17:23 | 專題:IJCAI:國際人工智能聯合會議 |
來源:PRML Research Group
原文鏈接:https://mp.weixin.qq.com/s/FHqth37DK0PvaLWGQvE3Sg?scene=1&click_id=72
在長程機器人操作領域,Vision-Language-Action(VLA)模型雖然展現了強大的潛力,但始終面臨一個核心瓶頸:累積誤差傳播。隨著任務步驟的增加,早期的微小偏差會不斷放大,最終導致任務失敗。這一限制很大程度上源于現有的靜態特征融合機制。傳統模型通常不考慮任務進度,在整個任務執行過程中無差別地學習對視覺、語言和動作表示等信息的注意力融合權重,無法根據任務執行的不同階段(如精準定位、高層規劃)來靈活調整對視覺、語言和動作表示的關注度。針對這一痛點,我們提出了S2-VLA框架,如圖1所示。該框架通過引入狀態空間引導的自適應注意機制(SSGAA),為機器人提供了一個能夠隨任務進度動態調整的“大腦”。

圖1 S2-VLA框架圖
在S2-VLA框架中,我們通過模型內部維護的一個緊湊隱含信念狀態,實現了對當前執行進度與歷史信息的遞歸匯總。這一機制使機器人能夠敏銳地察覺自身所處的任務階段,并具備檢測執行偏差的能力。基于該信念狀態,SSGAA模塊能夠動態生成門控權重,從而實時、精準地調節三類關鍵信息的融合配比,如圖2所示。

圖2 可視化解釋SSGAA模塊
從圖2的可視化結果中可以看出:在需要精準物體定位和空間對齊的階段(如接近目標時),模型會自動提升低階視覺權重的比例,以強化空間感知;在子任務切換或觸發抓取、釋放等關鍵決策點,模型則會顯著加強對語義意圖的理解,確保規劃的準確性;而在長距離的穩態運動中,系統通過維持動作序列的權重來保證操作的連貫性與一致性。通過上述任務階段引導的自適應權重調整,有效抑制了長程任務中的累積誤差。
在實驗評估方面,我們在LIBERO、SimplerEnv以及真實世界的ALOHA平臺上進行了廣泛驗證,結果表明S2-VLA在多個維度上均實現了顯著突破。首先,該模型成功刷新了SOTA記錄,盡管其參數量僅為2B,但在LIBERO等基準測試中的成功率一致超越了眾多7B規模的大模型,尤其在極具挑戰性的LIBERO-Long任務中,更是取得了96.4%的成功率。其次,在真實世界的泛化表現上,S2-VLA在ALOHA雙臂平臺執行抓取、堆疊及餐具分發等復雜任務時展現出卓越的性能,證明了其強大的現實遷移能力。最后,在部署效率上,該模型展現了極高的實用價值,推理時僅需7GB顯存,且吞吐量高達80.8Hz,在性能與速度上均顯著優于OpenVLA-OFT等現有主流方法。S2-VLA真機ALOHA表現如圖3所示,各項測試結果如表1和表2所示。

圖3 S2-VLA真機ALOHA表現

表1 S2-VLA在LIBERO Benchmark的表現

表2 S2-VLA 在SimplerEnv-Bridge的表現
整體而言,S2-VLA成功突破了靜態融合方法的性能瓶頸,證明了相位感知能力在長程機器人任務中的關鍵作用。通過將大模型的語義能力與實時狀態預測相結合,模型能更穩健地應對復雜環境下的誤差積累問題。未來,我們將探索將這一核心思想擴展到擴散模型等不同生成框架中,進一步提升機器人的動作建模能力。
詳見論文:
論文標題:S2-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation
作者:Zhipeng Xie, Zongyi Han, Xiangyi Wei, Shiliang Sun, Yang Li, Jing Zhao
研究機構:華東師范大學、上海交通大學
本專題其他文章