0
| 本文作者: 鄭佳美 | 2026-07-31 12:08 |
近日,基于全球首創的具身模型信息密度定律與以人為中心的環境式數據采集方案2.0,并依托環境式采集引擎ACE,大曉機器人聯合南洋理工大學 S-Lab 重磅開源 L5 級多模態具身物理智能數據集 ACE-Data-0。通過對真實物理交互、長程任務過程與多模態因果信號的高保真采集和高精度標注,ACE-Data-0 為全球具身模型提供面向泛化、反思與進化的高質量數據底座,推動通用物理智能加速跨越實驗驗證,走向規模化產業落地。
具身數據的價值不在于規模堆疊,而在于能否高密度記錄那些真正改變行動結果的信息;在這一定律下,L1-L2 級數據僅能支撐基礎預訓練,L3-L4 級數據止步于已知任務的擬合;ACE-Data-0 數據集已邁入 L5 級,深度融入接觸壓力、自然出現的猶豫與恢復過程,以及真實家庭場景中的開放行為變量,通過桌面尺度與房間尺度兩套互補采集系統,將真實家庭環境轉化為可持續記錄、統一標定和精準同步的具身數據采集場景,讓日常生活中的真實交互直接成為機器人學習物理世界的數據來源。

具體而言,ACE-Data-0 包含 150 小時數據、1700 萬幀視頻、200 個任務類別、50 名參與者、2 個真實家庭場景和 7.5 萬個交互片段,覆蓋原子級人—物交互、長時序家庭場景活動鏈及人與場景交互。數據同步采集第一人稱視頻、多視角第三人稱視頻、全身與手部運動、物體六自由度軌跡、多通道音頻與觸覺信號,并將全部模態對齊至同一時間線和空間坐標系,完整保留人類感知、行動、接觸與環境變化的連續過程。
基于 ACE-Data-0,大曉進一步構建了從底層信號、場景組成要素到具身交互理解的三級評測基準,系統檢驗模型在接觸感知、人體與物體狀態恢復、手—物交互理解等關鍵環節的真實能力。ACE-Data-0 因此不只是一批家庭場景活動視頻,更是一套面向模仿學習、世界模型、視覺—語言—動作模型(VLA)、機器人策略學習及人類示范向機器人遷移的具身數據基礎設施,為通用物理智能走進真實世界提供更完整、更可擴展的數據底座。
機器看見了動作,卻沒有看見完整的物理過程
過去幾年,視覺語言模型、VLA 和世界模型快速發展,但機器人真正進入物理世界后,仍然面對一個基礎問題:應該從什么數據中學習人類的行動能力?打開櫥柜、倒水、疊衣服等日常行為,同時涉及視覺、全身運動、手部操作、物體狀態、聲音、觸覺和任務規劃。普通視頻可以記錄發生了什么,卻難以準確呈現接觸何時發生、力度如何變化、物體怎樣運動,以及當前動作與前后任務之間的關系。
現有第一人稱視頻通常缺少精確的人體、手部和物體狀態;動作捕捉數據又多來自理想化實驗室,容易缺少自然遮擋、第一人稱視角、音頻和觸覺。大量數據還停留在持續數秒的抓取、放置等單步動作,難以描述真實家庭場景任務中的長期依賴。因此,ACE-Data-0 不再把活動切割成孤立短片,而是連續記錄感知、行動、接觸和狀態變化,讓不同模態共同描述同一個物理過程。其重點可以概括為:完整感知、長時序任務、多模態同步。
從桌面到房間:兩套系統覆蓋精細操作與長程活動
精細手部操作與房間尺度活動,對采集系統提出了截然不同的要求。指尖接觸、抓握變化和物體細微運動,需要近距離密集傳感器;人在廚房、客廳和臥室之間移動,則需要大范圍覆蓋、全局視角和統一空間坐標。為兼顧兩類需求,大曉將環境式采集引擎ACE設計為桌面尺度與房間尺度兩套互補配置,并基于兩套系統構建ACE-Data-0。
桌面尺度系統面向精細化手—物交互,在操作區域周圍布置多視角攝像機、光學動作捕捉和觸覺設備,重點記錄抓取、傾倒、擦拭、切割、折疊等任務中的手部姿態、物體軌跡和接觸變化。房間尺度系統覆蓋廚房、餐廳、客廳、臥室等完整家居空間,通過廣基線攝像機和全空間動作捕捉,持續記錄參與者的全身運動、跨區域移動,以及發生在場景不同位置的連續交互。

兩套配置共享統一的數據采集、同步、標定、質檢和標注流程:桌面尺度回答“手與物體如何精細交互”,房間尺度回答“人如何在完整環境中移動、規劃并完成任務”。采集過程中,參與者佩戴第一人稱設備,系統同步記錄四路魚眼視頻、IMU、頭戴設備位姿、全身運動和手部關節狀態;多視角外部攝像機則補足第一人稱視角中容易被遮擋的身體和環境信息。
每個活動時刻均由多個視角同步觀察,并與可度量的人體、手部和物體狀態對應,使自然行為與高精度物理監督得以同時保留。此外,ACE-Data-0 還記錄物體運動、全手掌觸覺壓力和多通道音頻。視覺描述外部變化,運動數據還原人體與物體軌跡,音頻記錄碰撞和設備狀態,觸覺則提供接觸、壓力與滑動信息。不同模態共同構成對同一次真實交互的完整觀察。
不是一堆數據流:把所有信號鎖定在同一時空
多模態數據真正的難點,不是設備夠不夠多,而是不同設備產生的數據能否準確對應。攝像機、動作捕捉系統、觸覺手套和音頻設備通常擁有獨立時鐘與不同采樣頻率。即使只有幾毫秒偏差,也可能出現畫面中的手尚未接觸杯子,觸覺信號卻已經產生的問題;如果不同攝像機、人體和物體沒有統一空間基準,也無法準確建立幾何關系。

通過時間同步與空間標定,ACE-Data-0 把視頻幀、人體動作、物體狀態、觸覺讀數和音頻統一到同一條時間線,并將外部攝像機、持續運動的第一人稱設備、人體、雙手和物體配準至共享世界坐標系。因此,每次采集并不是一組互不相關的數據流,而是一份對同一物理過程的統一記錄。研究者可以直接找到某個視頻幀對應的人體姿態、物體位置、接觸壓力和聲音變化,也可以比較第一人稱與第三人稱視角下的同一事件。
ACE-Data-0 進一步提供相機參數和同步時間線、人體及手部狀態、物體網格與六自由度位姿、邊界框、運動軌跡、手—物接觸信息,以及與物理時間線對齊的自然語言描述;其中,大量標注直接來自經過標定的采集系統,而非完全依賴模型事后估計。這使數據在遮擋、快速運動和長期任務中擁有更穩定的一致性,也讓模型能夠真正學習發生在同一時刻的視覺、動作、聲音和接觸。
不給標準答案:目標級采集保留真實行為差異
ACE-Data-0 覆蓋三類互補任務。第一類是原子級人—物交互,單次約3分鐘,包括倒水、清洗、擦拭、切割、折疊和整理等單項操作,即使最短序列也以分鐘計,而非傳統HOI數據中常見的數秒片段;第二類是多個原子動作組成的長時序家庭場景活動鏈,可持續20—30分鐘,例如從打開冰箱、取出食材,到清洗、切配、烹飪、裝盤和收拾;第三類是人—場景交互約5分鐘,包括移動、坐下、鍛煉、開關家具、取放物品及姿態轉換等。

與嚴格規定每一步動作的腳本式采集不同,ACE-Data-0 采用目標級指令。參與者只被告知最終任務,不被要求遵循固定流程,因此可以自由選擇物品、操作順序和移動路徑,也可能在過程中猶豫、改變計劃、返回上一步或處理意外情況。同樣是整理房間,有人先收拾桌面,有人先整理沙發;同樣是準備食物,不同參與者會選擇不同工具和順序。這些差異在標準化采集中可能被視為噪聲,但對于真正進入家庭場景的機器人來說,正是必須理解的現實。
長時序任務的難點也不只是“視頻更長”。此前的決定會改變后續可執行的動作,物體可能離開并重新進入視野,子任務可能中斷、重排或在其他位置繼續。模型必須持續記住任務目標、物體狀態和已經完成的步驟,而不能將活動視為一串彼此獨立的動作。ACE-Data-0 保留這些自然變化,使數據不再只提供理想化動作模板,而是記錄人類真實完成任務時的規劃、調整和恢復過程。
從采集數據到評估模型:ACE-Data-0的更大價值
基于 ACE-Data-0,大曉建立了由底向上的三級具身感知評估基準。第一級是底層信號推斷,研究模型能否從視覺觀測中預測接觸與觸覺信息;第二級是場景組成要素恢復,評估模型在遮擋、復雜姿態和持續運動下恢復人體與手部運動狀態的能力;第三級是具身交互理解,要求模型從第一人稱和第三人稱視頻中恢復接近、抓取、調整和釋放等完整手—物交互過程。
研究團隊進一步評測了30多種代表性方法。結果顯示,現有模型在接觸、嚴重遮擋、第一人稱自運動、極端視角和長時間任務中仍存在明顯能力缺口。

這套基準不只判斷任務最終是否成功,更試圖回答:模型究竟在哪一步失效?一次失敗可能源于沒有感知到接觸,也可能來自物體狀態估計錯誤、任務上下文丟失、動作順序理解偏差,或手部運動恢復不準確。分層評測將這些問題拆解開來,幫助研究者判斷模型已經理解了什么,又在哪一層發生能力斷裂。
ACE-Data-0 的價值也不止于評測。由于第一人稱視頻、多視角第三人稱視頻、人體與物體軌跡、音頻、觸覺和語言標注處于統一時空框架,它可以進一步服務于模仿學習、機器人策略學習、世界模型、VLA,以及人類示范向不同機器人本體的遷移。
在大曉機器人看來,具身數據建設不能只追求小時數和軌跡數,更需要保留真實世界中的物理聯系、任務結構、接觸反饋與狀態演化。“ACE-Data-0”中的“0”,代表這套具身數據體系的起點。未來,大曉機器人將繼續圍繞具身數據引擎、通用具身基礎模型、世界模型和 VLA 推進研發,并與研究機構、開發者及產業伙伴共同探索從人類自然行為到機器人通用能力的可拓展路徑。
從“看見動作”到“理解行動”,從孤立視頻到連續物理過程,ACE-Data-0 正在為具身智能建立一條更接近真實世界的數據入口。讓每一次真實生活中的感知、接觸與行動,都成為機器人理解物理世界的訓練信號。