0
| 本文作者: 袁毓婉 | 2026-08-03 11:32 | 專題: IROS:國際智能機器人與系統會議 |
來源:北京中關村學院
鏈接:https://mp.weixin.qq.com/s/W9oQ6Qhzyq_uzzHSAbMrSw
削蘋果對人類而言是一個再普通不過的動作:一只手握住蘋果并不斷旋轉,另一只手控制削皮器貼住表面,同時根據阻力調整切入深度。視覺負責判斷蘋果的位置和剩余果皮,手指觸覺用于防止蘋果滑落,手臂力覺則幫助控制削皮器與果皮之間的接觸。
但對機器人來說,削蘋果幾乎集中了靈巧操作中最困難的一組問題:雙臂需要持續協同,靈巧手需要穩定抓持并完成手內旋轉,工具必須保持合適的接觸力,多個技能還要在長時程任務中反復切換。任何一個環節出現誤差,都可能導致果皮沒有切下、蘋果從手中滑落,甚至削皮器與蘋果失去接觸。

現有視覺語言動作模型(Vision-Language-Action,VLA)已經能夠完成抓取、移動和放置,但這些成果大多基于二指夾爪和視覺主導的簡單任務。當機器人從低自由度夾爪擴展到雙臂、雙靈巧手,并進入連續接觸和手內操作場景時,數據采集、技能學習和力觸覺融合都會變得更加困難。
圍繞這一問題,北京中關村學院聯合研究團隊提出由IMCopilot與MoDE-VLA組成的類人雙臂靈巧操作系統:利用強化學習技能輔助人類采集高難度示范,再通過混合靈巧專家架構,將手臂力覺、指尖觸覺和預訓練VLA融合起來,使機器人能夠完成齒輪裝配、充電器插接、試管重排和蘋果削皮等復雜任務。
該成果已被機器人領域國際重要會議IROS 2026錄用。論文稱,據作者所知,該系統實現了首個自主雙靈巧手蘋果削皮任務。
論文標題:Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA
會議:IEEE/RSJ International Conference on Intelligent Robots and Systems(IROS 2026)
論文地址:https://arxiv.org/abs/2603.08122
當前VLA模型通常把機器人操作簡化為一組相對低維的動作:機械臂負責移動,二指夾爪負責開合。在這類系統中,機器人主要根據視覺判斷物體位置,并完成接近、抓取和放置。類人靈巧操作則完全不同。
該研究使用的機器人平臺配備兩條7自由度機械臂和兩只22自由度靈巧手,同時擁有可運動的頸部和上半身。在實驗狀態下,整套系統需要控制的自由度達到63個。機器人十個指尖均配備觸覺傳感器,可以提供六維力和力矩信息;兩條機械臂的關節力矩則用于反映手臂尺度的接觸和受力狀態。
自由度增加后,機器人不僅要決定“手移動到哪里”,還要協調每根手指如何彎曲、物體如何在手內旋轉,以及兩只手如何配合。蘋果削皮更要求機器人同時處理三類信息:
視覺信息負責定位蘋果、削皮器和剩余果皮;
手臂力覺反映削皮器切入果皮時受到的阻力;
指尖觸覺用于判斷蘋果是否穩定、是否發生滑移。
這使類人雙臂操作面臨三個相互關聯的瓶頸:高質量數據難以采集,一個模型難以同時學習差異巨大的操作技能,異構的力覺與觸覺信號也難以直接融合進預訓練VLA。
研究團隊首先搭建了一套面向雙臂靈巧機器人的沉浸式遙操作系統。操作者佩戴上肢外骨骼、外骨骼手套和VR頭顯,將人體手臂與手指動作映射到機器人,同時通過腳踏板調用輔助技能。
VR畫面不僅顯示機器人相機視角,還將手臂力矩和指尖觸覺以可視化方式疊加在畫面中。當機器人指尖接觸物體時,手套還會向操作者提供振動提示,幫助其判斷當前接觸狀態。
這套系統可以支持抓取、搬運和雙手交接等動作,但研究團隊發現,即使是熟練操作者,也很難通過純遙操作穩定完成連續手內旋轉。
原因在于,人手與機器人靈巧手之間存在結構差異。操作者不僅需要控制兩條機械臂,還要同時關注數十個手指關節、物體姿態和接觸狀態。在蘋果削皮任務中,人類如果無法遙操作機器人持續轉動蘋果,就無法獲得高質量示范數據,后續VLA訓練也無從開始。
因此,研究團隊沒有要求人類獨自完成所有低層動作,而是引入強化學習技能作為“副駕駛”。

研究團隊提出IMCopilot(In-hand Manipulation Copilot,手內操作副駕駛),將穩定抓持、手內旋轉等高難度動作訓練為可以隨時調用的原子技能。
這些技能首先在IsaacLab仿真環境中通過PPO強化學習訓練。訓練過程中,模型學習如何協調多個手指,在保持物體穩定的同時,使物體圍繞指定方向連續旋轉。通過對物體質量、摩擦系數、尺寸、重心和控制參數進行隨機化,技能可以從仿真遷移到真實靈巧手。
IMCopilot在整個系統中承擔雙重角色。在數據采集階段,人類仍然控制機器人手臂的整體運動;當任務進入手內旋轉階段時,操作者踩下腳踏板,由IMCopilot接管復雜的手指協調。完成旋轉后,人類繼續控制機器人執行后續動作。
在自主執行階段,是否調用IMCopilot不再由人決定,而是由VLA自己判斷。VLA的輸出中包含一個技能觸發信號:當模型認為需要旋轉蘋果時,IMCopilot接管靈巧手動作,而機械臂仍由VLA控制。
這種層級結構類似于人類運動控制:高層負責判斷目標和技能切換,經過大量練習的低層技能則負責快速、穩定地完成具體動作。
為了驗證IMCopilot是否真正解決了數據采集瓶頸,研究團隊使用乒乓球、網球和蘋果測試手內旋轉能力。
純遙操作的總體成功率只有34%,而使用IMCopilot后提高到89%。其中:
乒乓球操作成功率由10%提升至83%;
網球操作成功率由67%提升至93%;
蘋果操作成功率由27%提升至90%。
對于乒乓球和蘋果,物體容易從指尖滑落,操作者很難通過遙操作連續協調多根手指。IMCopilot則能夠根據手指狀態和觸覺反饋快速調整動作,完成更加穩定的手內旋轉。
力觸覺反饋也提高了數據采集效率。以齒輪裝配為例,在沒有反饋時,操作者完成100次采集需要75分鐘,其中85次成功;加入力觸覺反饋后,完成相同數量采集只需要65分鐘,成功示范增加到93次。
這表明,強化學習技能并不是要替代人類示教,而是幫助人類跨越高自由度遙操作中最困難的局部階段,從而獲得原本難以采集的高質量機器人數據。

解決數據采集問題之后,機器人還需要學習如何在自主執行過程中使用力覺和觸覺。
一種直接方法是將所有傳感器讀數拼接到VLA輸入中,但手臂力覺和指尖觸覺具有完全不同的物理含義:
兩條機械臂的14維關節力矩主要反映手臂尺度的受力,例如削皮器遇到的切削阻力;
十個指尖的60維六維力/力矩信號主要反映局部接觸,例如手指是否貼住蘋果、是否出現滑動。
如果把它們當成同一類狀態輸入,模型可能混淆不同傳感信號的作用,還可能破壞VLA原有的視覺語言能力。
為此,研究團隊提出MoDE-VLA(Mixture-of-Dexterous-Experts VLA,混合靈巧專家VLA)。該模型在預訓練π0主干之外,為力覺和觸覺分別建立專門的信息通路:
將手臂力矩和指尖觸覺編碼為獨立的多模態表示;
通過自注意力與視覺、語言和動作信息進行交互;
利用稀疏專家路由,讓不同專家分別處理自由空間、初始接觸、穩定抓持和手內旋轉等狀態;
將力觸覺產生的動作修正以殘差形式注入VLA輸出。
其中,力覺信息主要用于修正機械臂動作,觸覺信息主要用于修正靈巧手動作。這種設計避免了不同物理信號相互干擾。
殘差注入則保證MoDE-VLA不是重新訓練一個完全獨立的策略。當機器人處于自由空間、力觸覺信息較少時,修正量自然趨近于零,保留預訓練VLA原有的視覺語言操作能力;當機器人建立接觸后,力覺和觸覺專家才開始顯著調整動作。

研究團隊設計了四項難度逐漸提高的接觸密集任務:
齒輪裝配:依次抓取三個齒輪,并將其安裝到對應齒輪軸上;
充電器插接:抓取充電器,并將其插入插線板;
試管重排:右手取出倒置試管,將其交給左手,再插入目標位置;
蘋果削皮:右手控制削皮器,左手持握并旋轉蘋果,重復完成“削皮—旋轉”循環。
其中,齒輪裝配和充電器插接主要考察末端接觸、插入力調節和毫米級對準;試管重排需要雙臂協調和雙手交接;蘋果削皮則同時包含工具使用、穩定抓持、手內旋轉、連續接觸和長時程技能切換。
蘋果削皮過程中,VLA負責控制右臂和削皮器,使工具沿蘋果表面運動;當一次削皮動作結束后,模型觸發IMCopilot,由其控制左側靈巧手旋轉蘋果;隨后VLA重新開始下一段削皮動作,直到完成目標區域。
這使蘋果削皮成為檢驗整套系統的“終極任務”:任何一個模塊失效,機器人都難以完成完整循環。

實驗結果顯示,MoDE-VLA在四類任務上的平均成功率達到34%,相比π0基線的15%提升19個百分點。在不同任務中:
齒輪裝配成功率由40%提升至60%;
充電器插接成功率由5%提升至15%;
試管重排成功率由15%提升至30%;
蘋果削皮取得30%的完整成功率。
由于蘋果削皮包含多個連續循環,僅以“是否完整成功”評價容易忽略部分進展,因此論文還設置了削皮完成率指標。MoDE-VLA的平均削皮完成率達到73%,而π0基線只有8%。
消融實驗進一步說明了不同模塊的作用:
移除力覺輸入后,四類任務平均成功率由34%下降至23%;
移除觸覺輸入后,平均成功率下降至26%;
在蘋果削皮中移除IMCopilot后,削皮完成率由73%下降至25%。
力覺在齒輪裝配、充電器插接等任務中提供接觸發生和插入阻力信息;指尖觸覺幫助機器人維持穩定抓持、檢測滑移;IMCopilot則解決了VLA難以直接生成高自由度手內旋轉動作的問題。三者并非簡單疊加,而是在不同層級分別解決接觸感知、動作修正和技能執行問題。

這項工作表明,復雜類人操作未必能夠完全依靠一個端到端模型解決。
在蘋果削皮這樣的任務中,VLA擅長理解語言目標、處理視覺信息和組織長時程動作;力覺與觸覺負責揭示視覺無法直接觀察的接觸狀態;強化學習技能則承擔需要快速反應和高頻手指協調的手內操作。通過層級決策、專家分工和殘差修正,這些能力被整合到同一套雙臂靈巧操作系統中。
至此,“觸覺/力控多模態融合機器人操作策略研究和應用”項目的三項系列成果形成了一條連續技術路線:
TacReasoner讓機器人從連續接觸變化中理解物理屬性和接觸狀態;
ResTacVLA讓操作模型關注視覺無法預料的觸覺信息,并據此修正動作;
MoDE-VLA與IMCopilot進一步將VLA、強化學習技能、力觸覺感知和雙臂靈巧硬件融合起來,完成復雜類人操作。
三項研究分別回答了“如何理解觸覺”、“如何利用觸覺”和“如何依靠觸覺完成復雜技能”三個問題,推動機器人從視覺主導的動作執行,進一步走向能夠感知接觸、理解物理狀態并協調多種技能的多模態具身智能。
本成果依托北京中關村學院培育項目“觸覺/力控多模態融合機器人操作策略研究和應用”。項目圍繞觸覺感知、力控反饋、多模態操作策略和真實機器人系統開展連續研究,為具身智能在精密裝配、工具使用、智能制造和家庭服務等場景中的應用提供新的技術路徑。合作單位包括上海交通大學、Sharpa、上海人工智能研究院、新加坡國立大學、上海創智學院等機構。

