0

作者丨向 欣
編輯丨高景輝
雷峰網(公眾號:雷峰網)報道:
逛完今年的 WAIC,原力靈機展臺上那座由數萬塊積木搭建的長城令人印象深刻。

4 臺桌面機械臂和 2 臺輪式機器人 Apex 聯合作業 15 個小時,用近 8.2 萬塊微型積木拼出了一座 3.5 米長、1.5 米寬的長城模型。桌面機械臂以穩定的節奏拼接著微米級的積木塊,輪式機器人滑行穿梭,負責上料、搬運和整體巡視。
這座微縮長城的最小組件不到 1 厘米寬,拼裝精度進入亞毫米區間,超越了人手自然抖動的極限。遇到偏差,機器人能自主感知、即時糾錯,重新調整姿態后再嘗試。
原力靈機讓人印象深刻的地方在于,精細操作、錯誤恢復、多機協同能力能在同一套系統里并行運轉十幾個小時。展館里提全棧的廠商很多,但把這些能力串成一條完整作業線跑通的并不多。
他們是怎么做到的?我們在現場和原力靈機聯合創始人范浩強聊了聊。展臺上的動作只是表象,那些背后的技術判斷和產業思考,更值得仔細琢磨。

01
今年 WAIC 上,不少廠商直接把產線搬進展廳,試圖用最直觀的方式證明落地能力。原力靈機同樣以工業落地為目標,卻選了不太一樣的展示方式:用積木搭長城。
理由很簡單。工廠產線太專業了,普通觀眾可能會看不懂,更重要的是也提不起興趣。積木就不一樣了,人人都玩過。
形式是積木,邏輯其實是產線。上料、裝配、質檢、下料、異常恢復……這些環節和工廠里的流水線一模一樣。而積木本身也成了一個溝通工具:觀眾看到的是長城,潛在客戶看到的是展商的能力邊界。
這次積木長城的展項,系統展示了具身智能的三大能力:精細操作、錯誤恢復、多機協作。
積木的拼接公差是微米級的,遠超機械臂自身的重復定位精度。機器人需要先靠視覺判斷偏移方向,難點之一是,最后接觸的那一刻,視覺已無法分辨,必須轉而依賴其他感知方法。
原力靈機的方案是在執行末端裝上六維力傳感器,它會和關節電流共同推斷受力狀態,決定是繼續壓還是停下來。
單做視覺、單做力覺都有人能實現類似的方案,其中難點在于把多模態信號集成進同一個模型還能跑通。這背后是具身通用基礎模型 DM0.5 的支持:它引入了歷史關鍵幀實現分鐘級任務記憶,訓練中擴展了時序推理能力,推理速度在單卡 4090 上可達到 10Hz。
但真正花時間最多的地方,還不是精度,而是異常流的處理,即錯誤恢復能力。
很多人對工業場景的想象會有一個預設前提:機器人必須做到完美無缺,才有資格走進產線。但一個反直覺的事實是,產線最看重的反而不是完美,而是在出錯之后自己可以進行調整恢復,不讓整條線停下來。這也更加貼合人類在產線中的工作狀況。畢竟百分之幾的廢品率可以接受,產線一停就是真金白銀的損失。
現在大家展示的抗干擾能力,面對的情況其實有兩種。一種是人為制造的,例如用手電筒照一照改變光線,或者推一推物品改變位置,機器人再調整回來。不過這種變動未必和真實工況相符。
另一種則是自然環境中自然產生的錯誤。例如,在這次積木長城的案例中,積木本身會有公差,有的凹槽緊一些,有的松一些,拼裝過程中隨時可能出現偏差,零件可能會崩出去,掉落到隨機的位置,這些就屬于自然產生的錯誤,很難預演。
原力靈機的方法是大量采集真實失敗場景的數據,配合 RL 讓模型從自身運行分布中學習。其訓練數據主要來自真機遙操作,每個月能采集數萬小時的真實操作數據。
盡管他們也有使用仿真數據,但范浩強認為,一方面,在 GPU 里模擬一次,花的錢和能耗可能比真實做一次還大,另一方面,地球其實是最好的模擬器。
這套真機數據訓練+RL 的模式,聽起來門檻不高,但一層層拆開看,每一級都在疊加難度。100 臺機器人同時采數據已經很難,還要帶著算法一起采,本質上每個數據采集任務都是一個獨立項目。原力靈機的DW0.5 世界模型在其中扮演后訓練環境的角色,用幀級綁定和密集反饋機制加速了這個過程。
除此之外,6 臺機器人還要協同工作。桌面機器人負責精細拼接,兩臺輪式機器人負責上料、下料和巡視。整個調度由一個 Agent 完成,這個 Agent 直接調用了階躍星辰最新的大模型。它要感知誰缺料了、誰的組件完成了、整體進度怎么樣,然后把任務分解成對原子技能的調用。

這就和真正的產業應用是同樣的邏輯了。搭長城,其實是在搭一條產線。

02
今天能搭積木,明天能不能搭別的?可以。
這次積木長城背后的具身模型是以原子性動作作為學習單元的,一拿、一放、一塞、一拉……新任務到來時,模型可以進行子任務拆解,重新組合,具備任務泛化能力。

比如一個牙膏包裝的場景,今天要裝一管,明天要裝兩管,后天要裝進不同尺寸的盒子,模型不需要重新編程,只需要理解新的指令,調整子任務的排列。這跟拼積木的邏輯一脈相承。
很多場景里的任務,其實都是pick and place型任務的變體。物流分揀、工業上下料、裝配、回收料整理,抽象來看都是在做同一件事:把一個東西從一個地方運到另一個地方,只不過 pick 和 place 的環節各有要求,于是變成了揀選、變成了裝配、變成了打包。原子技能的拆解邏輯,對應的就是這種任務本質。
原力靈機選擇落地場景的邏輯是,不做流水線中間的高頻節拍,那些用非標自動化更經濟,而是做線頭線尾的「零碎活」:料盤用完要拿走、材料卷用完了要上新卷、不同批次的產品需要不同的包裝方式。這些動作很難用一套固定的自動化設備實現,占地面積大、稼動率低,但恰好是機器人柔性能力的用武之地。
多機協作的展示也對應產業場景:輪式機器人給桌面設備上料下料、巡視全局,和工廠里一個員工盯幾臺自動化設備的模式一致。
在硬件設計上,原力靈機的想法也比較超前。
Apex 走圓潤親切路線,原力靈機考慮到一線操作人員接受一個新事物需要過程,外形柔和一些,攻擊性和壓迫感天然就會降低,安全性在觀感上也更容易建立信任。很多廠商今年才開始往這個方向靠,原力靈機在設計之初就已經把這一點考慮進去了。

這種設計思路也幫助原力靈機打開了工業之外的空間,商業場景也在推進中,沃爾瑪、優衣庫等品牌已經和他們接洽試用。
此外,導航攝像頭裝在左右兩側而非腦袋前后,既是審美選擇也體現了全棧算法能力:有些公司攝像頭一換位置算法就適配不了,原力靈機因為算法全棧自研,硬件設計自由度更大。

03
原力靈機能在展臺上搭出這座長城,其技術能力是來自一個更長的積累鏈條。
首先是團隊積累深厚。原力靈機由曠視聯合創始人、前 CTO 唐文斌創立,核心團隊全部來自曠視核心研究院和業務線。范浩強本人也是曠視時期的資深技術骨干。這支團隊從 ResNet 時代就開始做視覺模型研究,在 AI 1.0 時代積累了長時間的經驗。
現在業界存在 VLA 模型和世界模型的技術路線之爭,但在他們看來,這有點像問輪子和激光雷達誰更重要,其實它們都是一輛車里有用的組件,非要辯出誰用誰不用,在技術上不成立。原力靈機提「具身原生模型」的概念,核心邏輯就是:有用的技術都用,不站隊。
這個方法論也延續到了他們的研發哲學里。團隊在 Transformer 時代做過一次驗證,證明了 CNN 加上特定配置也能做 Transformer 能做的視覺問題。他們的思維方式是做「還原論式」的思考:把一個技術 work 的本質和核心提煉出來,再去應用。
更關鍵的是對數據的理解。原力靈機從第一天就把數據當作核心要素來對待。
我們了解到,原力靈機團隊在曠視做計算機視覺的時候,就講究「數據、算法、系統」三要素,其中數據是第一位的。算法決定在數據充分時能否把能力發揮出來,系統決定能否把算法的表現最終呈現出來。這個認知被完整地搬到了具身智能領域。
之所以從第一天就把數據當作核心要素,也是因為他們重視系統化工程能力。
所謂系統化工程能力,是把硬件、驅動、深度學習基礎設施全鏈條系統化的能力,這里面涉及大量的基建工程。原力靈機開源了 Dexbotic 2.0 一站式 VLA 開發框架、DM0、DM0.5、DW0.5 系列模型權重與配套訓練推理代碼,目的之一就是為了展示自己在這些方面的思考和投入。
在系統能力的搭建上,今年原力靈機節奏很快:2 月發布 DM0,7 月 Action2026 開發者大會一口氣推出 DM0.5、Apex 本體和 DFOL2.0、MaaS、DexOS 三件套,從模型到本體到開發工具到云服務,完整的產品矩陣已經就位。
回到 WAIC 的展臺上。今年我們看到不少廠商都在展示泛化能力和長程任務,有的疊衣服,有的用烤面包機,有的做咖啡,的確百花齊放。但原力靈機的「積木長城」仍然是獨特的:它展示了一條完整作業流的系統化運轉,精細操作、錯誤恢復、多機協同、任務調度,所有這些能力在同一套系統里跑通,持續十幾個小時。

WAIC 上的長城竣工了,具身智能的征程才剛剛開始。下一步,它們要去真正的工廠解決真問題。而能同時把模型、系統、場景三件事都做到極致的公司,才有可能穿越具身智能的技術周期與產業周期,原力靈機至少已經把這三件事都做在了前面。(雷峰網)
上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。