0
| 本文作者: 陳淑瑜 | 2026-07-13 18:15 | 專題:RSS:機(jī)器人,科學(xué)與系統(tǒng)會(huì)議 |
今年的 RSS 2026最終被主會(huì)接收并放進(jìn)官方日程的論文僅僅 160 篇左右,極低的接受率說明了RSS的含金量一如既往的高,每一篇都經(jīng)得起全場(chǎng)幾百位頂尖研究者的嚴(yán)苛推敲。
雷峰網(wǎng)&AI科技評(píng)論已派出報(bào)道小組抵達(dá)會(huì)議現(xiàn)場(chǎng)。在簡(jiǎn)單的開幕式后,緊跟著的是“Manipulation 1: World Models & Memory”論文報(bào)告環(huán)節(jié),來自全球頂尖實(shí)驗(yàn)室的研究者們展示了機(jī)器人操作領(lǐng)域的最新突破。從雙臂協(xié)同、手術(shù)輔助到水下靈巧操作,一個(gè)共同的趨勢(shì)正在浮現(xiàn):機(jī)器人正在擺脫對(duì)海量標(biāo)注數(shù)據(jù)的依賴,邁向“少樣本、強(qiáng)泛化”的新階段。
研究者們不再死磕千萬次高昂的遙操作采集,而是各顯神通:有的從人類視頻里“白嫖”數(shù)據(jù),有的用觸覺手套實(shí)現(xiàn)跨物種對(duì)齊,還有的在推理時(shí)加裝“安全護(hù)欄”。
以下是我們從該環(huán)節(jié)精選的 9 篇代表作,帶你一文看懂機(jī)器人如何以極低的成本,學(xué)會(huì)干最精細(xì)的活。如果你也想讓你的研究成果出現(xiàn)在這里,請(qǐng)與我們聯(lián)系。
既然真機(jī)數(shù)據(jù)難以海量采集,研究者們將目光投向了最豐富的資源庫——人類的日常行為。如何跨越“人與機(jī)器”的結(jié)構(gòu)鴻溝,直接提取知識(shí)?
雙臂靈巧操作一直是機(jī)器人領(lǐng)域的硬骨頭。兩只手的協(xié)同遠(yuǎn)比單手復(fù)雜,而高質(zhì)量的演示數(shù)據(jù)又極其昂貴。現(xiàn)有的方案往往陷入兩難:遙操作采集數(shù)據(jù)可靠卻費(fèi)時(shí)費(fèi)力,仿真合成效率雖高卻難以跨越虛實(shí)鴻溝。華南理工大學(xué)的研究團(tuán)隊(duì)試圖打破這一僵局。
他們提出了BiDemoSyn框架,核心思路是將雙臂操作任務(wù)拆解為“不變協(xié)調(diào)塊”與“可變物體適應(yīng)”兩部分。前者負(fù)責(zé)捕捉雙臂間不隨任務(wù)改變的協(xié)同模式,后者則負(fù)責(zé)根據(jù)具體物體的形狀和位姿進(jìn)行靈活調(diào)整。 基于這種解耦,該框架通過視覺引導(dǎo)對(duì)齊和輕量級(jí)軌跡優(yōu)化,僅需一段真實(shí)世界的示范視頻,便能在數(shù)小時(shí)內(nèi)自動(dòng)合成數(shù)千條物理可行的多樣化訓(xùn)練數(shù)據(jù)。
在六個(gè)雙臂任務(wù)的實(shí)驗(yàn)中,用BiDemoSyn數(shù)據(jù)訓(xùn)練的策略不僅能魯棒泛化到新物體的位姿和形狀,還實(shí)現(xiàn)了零樣本跨本體遷移,這意味著即便更換機(jī)器人平臺(tái),這套系統(tǒng)也能直接上手工作。 我們離“教一次就能干活”的實(shí)用雙臂機(jī)器人又近了一步。

互聯(lián)網(wǎng)上充斥著人類切蘋果、倒飲料、疊杯子等操作各種工具的視頻,但由于人類手部與機(jī)器人靈巧手在結(jié)構(gòu)上差異巨大,這些視頻的訓(xùn)練價(jià)值長期遭到忽視。 這種“具身鴻溝”讓直接從人類視頻中預(yù)訓(xùn)練變得極其困難。上海人工智能實(shí)驗(yàn)室和清華大學(xué)的研究者決定正面攻克這一難題。
他們?cè)O(shè)計(jì)的DexImit是一個(gè)四階段的自動(dòng)化生成管線:首先從任意視角重建精度極高的手-物交互三維結(jié)構(gòu);接著對(duì)復(fù)雜任務(wù)進(jìn)行子任務(wù)分解與雙臂調(diào)度規(guī)劃;然后合成與人類演示高度一致的機(jī)器人軌跡;最后通過綜合數(shù)據(jù)增強(qiáng)確保其能零樣本部署到真實(shí)世界。
這套流程的革命性在于,它能直接吃透互聯(lián)網(wǎng)上的任意人類操作視頻甚至AI生成的視頻。從工具使用到精細(xì)操作,當(dāng)靈巧手不再需要從頭采集昂貴的訓(xùn)練數(shù)據(jù),機(jī)器人“學(xué)會(huì)動(dòng)手”的門檻被大幅降低了。

僅需人類戴上觸覺手套演示一次,機(jī)器人便能掌握擰燈泡的技巧,這在以往簡(jiǎn)直是天方夜譚。 穿戴設(shè)備采集的人類觸覺信號(hào)直觀豐富,但如何將其遷移到傳感器和本體結(jié)構(gòu)截然不同的機(jī)器人上,一直是個(gè)痛點(diǎn)。現(xiàn)有方法大多要求設(shè)備高度一致且需要成對(duì)的訓(xùn)練數(shù)據(jù),嚴(yán)重限制了擴(kuò)展性。
來自UC Berkeley和Meta等機(jī)構(gòu)的研究者提出了令人耳目一新的TactAlign:用整流流(rectified flow)將人類和機(jī)器人的觸覺觀測(cè)映射到同一個(gè)共享潛在空間。最關(guān)鍵的是,這個(gè)對(duì)齊過程不需要配對(duì)數(shù)據(jù)集、人工標(biāo)注或特權(quán)信息。對(duì)齊的“錨點(diǎn)”直接來源于手物交互中自然產(chǎn)生的偽配對(duì)。簡(jiǎn)單來說,無論是人手還是機(jī)械手,在抓取同一物體時(shí),其物理交互模式必然存在某種共性。
在接觸密集型任務(wù)上,TactAlign顯著提升了人機(jī)策略的遷移效果。在擰燈泡這種高靈巧任務(wù)中,僅需不到五分鐘的人類觸覺數(shù)據(jù),就成功實(shí)現(xiàn)了零樣本遷移。

解決了數(shù)據(jù)來源,下一個(gè)難題是“環(huán)境突變”。在仿真里學(xué)得好好的,到了真實(shí)世界就翻車;在實(shí)驗(yàn)室里能抓水杯,到了水下或手術(shù)室就失控。如何讓機(jī)器人擁有抗干擾的泛化能力?
手術(shù)機(jī)器人面臨的環(huán)境遠(yuǎn)比工廠流水線復(fù)雜:組織會(huì)變形、視野會(huì)遮擋,任何一個(gè)小失誤都可能致命。傳統(tǒng)手術(shù)機(jī)器人嚴(yán)重依賴多相機(jī)系統(tǒng)和海量演示數(shù)據(jù),導(dǎo)致技術(shù)落地異常困難。對(duì)此,德國國家腫瘤疾病中心的研究團(tuán)隊(duì)給出了一個(gè)更輕量的答案。
他們提出了一種監(jiān)督式混合專家(MoE)架構(gòu),能像插件一樣疊加在任意自主策略之上。令人驚訝的是,僅配合立體內(nèi)窺鏡圖像作為唯一輸入,疊加MoE后的輕量級(jí)Action Chunking Transformer僅需不到150條演示數(shù)據(jù),就能學(xué)會(huì)復(fù)雜的“腸道抓取與牽拉”長時(shí)序協(xié)作任務(wù)。在此過程中,機(jī)器人不僅要讀懂外科醫(yī)生的視覺提示,準(zhǔn)確抓取可變形組織,還要保持穩(wěn)定的牽拉。
更值得關(guān)注的是其泛化表現(xiàn)。面對(duì)新場(chǎng)景,通用視覺-語言-動(dòng)作模型完全失效,標(biāo)準(zhǔn)ACT也頻頻掉鏈子;而MoE增強(qiáng)版本不僅在弱光、遮擋及全新抓取位置等干擾下保持穩(wěn)健,還成功在離體豬組織上實(shí)現(xiàn)了零樣本泛化,甚至完成了體內(nèi)豬手術(shù)的初步驗(yàn)證。這無疑為手術(shù)機(jī)器人的臨床落地釋放了強(qiáng)烈的積極信號(hào)。

使用工具看似簡(jiǎn)單,實(shí)則需要解決“用哪里”(語義理解)和“用多大力”(物理精度)兩個(gè)層次的挑戰(zhàn)。當(dāng)前的視覺-語言-動(dòng)作模型擅長前者卻在力控上捉襟見肘,而純觸覺策略雖精度高卻不夠通用。更棘手的是,大規(guī)模采集真實(shí)觸覺數(shù)據(jù)的成本極高,且仿真與真實(shí)傳感器數(shù)據(jù)之間存在復(fù)雜的非線性變形,導(dǎo)致零樣本遷移幾乎難以實(shí)現(xiàn)。
新加坡A*STAR和NUS的研究團(tuán)隊(duì)提出了Semantic-Contact Fields(SCFields),將視覺語義與密集接觸估計(jì)融合到統(tǒng)一的三維表示中。他們?cè)O(shè)計(jì)了一個(gè)兩階段的Sim-to-Real學(xué)習(xí)管線:先在大規(guī)模仿真數(shù)據(jù)上預(yù)訓(xùn)練接觸先驗(yàn),再用幾何啟發(fā)式和力優(yōu)化在少量真實(shí)數(shù)據(jù)上進(jìn)行偽標(biāo)注微調(diào)。
最終,這個(gè)力感知的表示被送入擴(kuò)散策略作為觀測(cè)輸入。實(shí)驗(yàn)證明,SCFields能在未見過的工具實(shí)例上實(shí)現(xiàn)類別級(jí)泛化,大幅超越純視覺和原始觸覺基線方法。用仿真批量學(xué)、用真實(shí)數(shù)據(jù)精調(diào),正在成為觸覺操作的新范式。

水下機(jī)器人操作面臨著獨(dú)特困境:水體會(huì)導(dǎo)致光線散射和顏色嚴(yán)重失真。如果要在多樣化場(chǎng)景中采集水下演示數(shù)據(jù),不僅需要專業(yè)潛水設(shè)備和人員,成本更是天文數(shù)字。 斯坦福大學(xué)和哥倫比亞大學(xué)的研究者想到了一個(gè)巧妙的迂回策略:在水上教,到水下用。
UMI-Underwater系統(tǒng)包含一種基于深度信息的可供性表示。由于深度圖在不同光照和水質(zhì)條件下遠(yuǎn)比RGB圖像穩(wěn)定,它順理成章地成為了彌合陸地與水下域間差距的“通用語言”。 系統(tǒng)在陸地手持演示數(shù)據(jù)上訓(xùn)練模型,通過幾何對(duì)齊即可零樣本部署到水下。同時(shí),該系統(tǒng)還配合了一個(gè)自監(jiān)督數(shù)據(jù)采集管線,讓機(jī)器人自主在水下試錯(cuò)并記錄成功案例。
泳池實(shí)驗(yàn)顯示,該方法在水下抓取性能和魯棒性上全面超越了純RGB方法,甚至能泛化到僅在陸地?cái)?shù)據(jù)中出現(xiàn)過的物體。海洋探索的自動(dòng)化大門,正在以更低成本的方式徐徐打開。

除了數(shù)據(jù)和環(huán)境,大語言模型的架構(gòu)直接套用在機(jī)器人上并不完美。研究者們開始回歸機(jī)器人的物理本質(zhì),探尋最優(yōu)的數(shù)據(jù)配比、控制閉環(huán)與安全機(jī)制。
視覺-語言-動(dòng)作(VLA)模型是當(dāng)前通用機(jī)器人策略的主流架構(gòu),但在共訓(xùn)練的數(shù)據(jù)配比上一直缺乏系統(tǒng)性指導(dǎo)。除了機(jī)器人的本體數(shù)據(jù),到底該摻雜視覺-語言數(shù)據(jù)、跨本體數(shù)據(jù)、人類視頻,還是離散動(dòng)作token?Meta AI的研究團(tuán)隊(duì)用一場(chǎng)大規(guī)模實(shí)證研究給出了定論。
這項(xiàng)研究規(guī)模驚人:利用4000小時(shí)操作數(shù)據(jù)和5000萬視覺-語言樣本,訓(xùn)練了89個(gè)VLA策略,并進(jìn)行了超過六萬次測(cè)試。結(jié)論非常清晰:視覺-語言數(shù)據(jù)和跨本體機(jī)器人數(shù)據(jù)堪稱“黃金搭檔”,兩者聯(lián)合共訓(xùn)練能顯著提升模型對(duì)分布偏移、未見任務(wù)以及自然語言指令的泛化能力;相比之下,離散動(dòng)作token則收效甚微。
研究還發(fā)現(xiàn),僅用機(jī)器人數(shù)據(jù)訓(xùn)練會(huì)嚴(yán)重退化大模型的視覺語言理解能力,但加入共訓(xùn)練數(shù)據(jù)后即可有效恢復(fù)。這些翔實(shí)的結(jié)論,為社區(qū)構(gòu)建下一代通用機(jī)器人策略提供了寶貴的“數(shù)據(jù)菜譜”。

機(jī)器人操作最怕遇到突發(fā)狀況:物體位置變了、角度偏了或受到外界擾動(dòng)。此時(shí),僅靠幾次演示訓(xùn)練出來的端到端策略幾乎必然會(huì)“掉出分布”,進(jìn)而做出不可預(yù)測(cè)的危險(xiǎn)動(dòng)作。 香港科技大學(xué)的研究團(tuán)隊(duì)提出了一種新范式:與其死磕數(shù)據(jù),不如在推理時(shí)主動(dòng)把系統(tǒng)“拉回”安全區(qū)。
SID框架的核心是一個(gè)以物體為中心的運(yùn)動(dòng)場(chǎng)。該運(yùn)動(dòng)場(chǎng)通過學(xué)習(xí)規(guī)范化的演示,能在機(jī)器人偏離正常軌跡時(shí)提供大幅度的糾正運(yùn)動(dòng),將系統(tǒng)逐步“滑”回可靠的操作區(qū)域。 一旦接近目標(biāo),運(yùn)動(dòng)場(chǎng)會(huì)自然衰減,交由輕量級(jí)的自我中心執(zhí)行策略完成精細(xì)操作。
這種“全局粗調(diào)+局部精調(diào)”的解耦設(shè)計(jì),讓SID在僅有兩次演示的極限條件下依然穩(wěn)健。在六個(gè)真實(shí)世界任務(wù)中,它在分布外初始條件下依然能保持約90%的成功率。這啟示我們:少樣本操作的瓶頸或許不在于策略不夠強(qiáng),而是缺乏顯式管理分布偏移的機(jī)制。

多指靈巧手的接觸密集型操作始終是機(jī)器人領(lǐng)域的一大難題,這類任務(wù)的成敗高度依賴于多個(gè)接觸點(diǎn)的持續(xù)演化, 而這些狀態(tài)對(duì)物體幾何和滑移極為敏感。以往的研究大多把觸覺當(dāng)成“額外輸入”,既不顯式建模接觸狀態(tài),也忽視了動(dòng)作策略與底層控制器的動(dòng)力學(xué)交互,導(dǎo)致策略給出的目標(biāo)往往無法在物理世界執(zhí)行。
來自UCSD、Brown和Sony AI的研究團(tuán)隊(duì)提出了Contact-Grounded Policy(CGP)視覺-觸覺聯(lián)合策略框架。該框架包含兩個(gè)核心組件:其一是條件擴(kuò)散模型,用于預(yù)測(cè)機(jī)器人狀態(tài)與觸覺反饋的耦合軌跡;其二是可學(xué)習(xí)的“接觸一致性映射”,它能將上述的聯(lián)合預(yù)測(cè)直接轉(zhuǎn)化為柔順控制器可執(zhí)行的目標(biāo)狀態(tài),從而確保控制系統(tǒng)真正落實(shí)預(yù)測(cè)出的接觸意圖。
在配備高精度觸覺傳感器的真實(shí)和仿真機(jī)械手上,CGP在操控、抓取和工具使用等任務(wù)中均顯著優(yōu)于現(xiàn)有基線。這項(xiàng)工作指明了方向:觸覺不應(yīng)只是錦上添花的額外觀測(cè),必須成為連接AI策略與物理現(xiàn)實(shí)的“接地”橋梁。
三個(gè)方向,九篇論文,一條主線貫穿始終:機(jī)器人操作正在從“數(shù)據(jù)饑渴”走向“樣本高效”。
無論是BiDemoSyn通過一次演示合成數(shù)千條數(shù)據(jù)、SID用兩次演示實(shí)現(xiàn)九成成功率、DexImit從人類視頻中自動(dòng)提取操作知識(shí),還是CGP讓靈巧手真正感知接觸狀態(tài),這些前沿探索都共同指向了一個(gè)未來: 機(jī)器人再也不必在實(shí)驗(yàn)室里苦熬千萬次演示。
雷峰網(wǎng)(公眾號(hào):雷峰網(wǎng))&AI科技評(píng)論將繼續(xù)在現(xiàn)場(chǎng)帶來更多RSS 2026的精彩內(nèi)容,如果你想推薦RSS上的其他論文,歡迎聯(lián)系我們進(jìn)一步交流探討 。
一個(gè)人讀論文太孤單,一群人刷頂會(huì)才好玩。
RSS 2026 召開在即,我們正在召集一波含金量極高的 AI 研究者。群內(nèi)主打實(shí)時(shí)論文跟蹤與硬核技術(shù)探討,拒絕灌水。
? 進(jìn)群傳送門: 掃碼進(jìn)群或添加微信Luyoyo_2026,備注:論文群 + 關(guān)注的 AI 方向。

搞科研/搞技術(shù),信息差很重要。
來,一起快人一步!
上車,帶你看遍全球 AI 頂會(huì)精華
可獨(dú)家暢覽:
專家演講PPT
大會(huì)報(bào)告全文
熱門論文解讀
學(xué)術(shù)新星訪談

掃描上方二維碼
或點(diǎn)擊「閱讀原文」關(guān)注專區(qū)。
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。
本專題其他文章