0
| 本文作者: 齊鋮湧 | 2026-06-02 18:46 |

作者丨齊鋮湧
編輯丨馬曉寧
你有沒有發(fā)現(xiàn),2026年的具身智能賽道,很多公司都在考慮中途換帆。
從人形到輪式、從物流到家庭,大量創(chuàng)業(yè)公司在技術(shù)路線和場(chǎng)景選擇上反復(fù)橫跳,仿佛誰先調(diào)頭誰就能活下去。在此背景下,AI 科技評(píng)論希望找到具身賽道里的“篤定派”。
靈初智能進(jìn)入了我們的視野。
這家具身公司在過去一年半時(shí)間里,累計(jì)融資超20億元,國(guó)家隊(duì)資本密集進(jìn)入,估值一年漲六七倍。2026年5月7日,摩根士丹利發(fā)布《Humanoid Horizons: Money Meets Machines》,在其"中國(guó)-人形機(jī)器人價(jià)值鏈"圖譜中,靈初智能作為"Brain(大腦)"板塊的關(guān)鍵一員被列示。
在我們看來,除了00后天才少年陳源培的光環(huán)加持,靈初智能還有一個(gè)非常稀缺的特點(diǎn):這是一家從第一天起就錨定方向做輪式底盤加雙臂通用靈巧操作的公司。
堅(jiān)持追求靈巧操作,這種篤定在今天的具身賽道非常稀缺。這份“篤定”最初來自靈初智能創(chuàng)始人兼CEO王啟斌的判斷,我們就此話題跟他聊聊他眼中的具身賽道。
王啟斌從黑莓手機(jī)做到Sonos音箱,從云跡科技的室內(nèi)配送機(jī)器人做到京東的L4無人車,2024年9月創(chuàng)立靈初智能。"2018年我選擇機(jī)器人賽道時(shí),就想找一個(gè)面向未來的十年長(zhǎng)賽道。"王啟斌說,"但現(xiàn)在看來,這個(gè)行業(yè)的變化速度比我想象的還快。但在快速變化中,他始終認(rèn)為,操作才是皇冠上的明珠,移動(dòng)只是入場(chǎng)券。
在這場(chǎng)對(duì)話里,他會(huì)分享具身賽道的真實(shí)創(chuàng)業(yè)經(jīng)歷,數(shù)據(jù)飛輪的行業(yè)真相、具身大腦的生死命題,以及行業(yè)終局判斷。
以下是王啟斌與 AI 科技評(píng)論的對(duì)話,經(jīng)編輯整理:

01
▎AI 科技評(píng)論:你最早在黑莓做智能手機(jī),后來做Sonos音箱,再到云跡和京東無人車,2024年創(chuàng)立靈初。這條路徑看起來是從消費(fèi)電子到移動(dòng)機(jī)器人,再到具身智能。2018年你為什么篤定機(jī)器人是下一個(gè)十年賽道?
王啟斌:2008年從喬治華盛頓大學(xué)回來后,前十年我一直在做消費(fèi)品。在黑莓時(shí)正值智能手機(jī)轉(zhuǎn)折期,后來做Sonos是全球第一家智能WiFi音箱。那個(gè)年代我們主要做全球公司在大中華區(qū)的產(chǎn)品負(fù)責(zé)人角色。
2010年前后是移動(dòng)互聯(lián)網(wǎng)興起,智能手機(jī)因?yàn)橛芯薮髠鞲衅骱驮破脚_(tái),端側(cè)能力爆發(fā),產(chǎn)生了APP生態(tài)。音箱是個(gè)小波浪,當(dāng)時(shí)大家想做成Voice VUI,但NLP比較弱。我在看下一個(gè)終端形態(tài)時(shí),覺得機(jī)器人是一個(gè)可移動(dòng)的終端,很有意思。
2018年加入云跡科技,那時(shí)候行業(yè)基于SLAM技術(shù)做移動(dòng)能力。后來去京東做L4無人車,從室內(nèi)延伸到室外三維空間。2020年底看到ChatGPT出來后,我們預(yù)判模型能力會(huì)不停迭代,具身智能會(huì)有新機(jī)會(huì)。2024年成立靈初,從一開始聚焦的就是操作,人形從來不是我們最關(guān)注的。
▎AI 科技評(píng)論:2024年行業(yè)都在追人形機(jī)器人,你們?yōu)槭裁捶炊x擇輪式+雙臂?
王啟斌:2024年我們做融資BP時(shí)畫了一個(gè)圖,綜合移動(dòng)能力x操作能力看,當(dāng)時(shí)存量市場(chǎng)有云跡,高仙等主打移動(dòng)能力,也有具身這波特斯拉和宇樹,這樣主打"移動(dòng)+人形",我們定位在"移動(dòng)+雙手操作"方面。
任何一個(gè)移動(dòng)的機(jī)器人,如果不能閉環(huán)去做任務(wù)操作,它一定無法解決客戶需求里最重要的那部分。這是我在云跡和京東最大的教訓(xùn)。我們把機(jī)器人的移動(dòng)能力,從酒店走廊拓展到了城市道路,從室內(nèi)延伸到了戶外,但只要它不能用手完成最后一步,任務(wù)就始終停在“運(yùn)到”,而不是“做到”。所以2024年10月我們就預(yù)判,主流解決方案形態(tài)應(yīng)該是輪式加雙臂,操作價(jià)值遠(yuǎn)高于移動(dòng)。
直到今天,我們依然堅(jiān)持這個(gè)判斷。

02
▎AI 科技評(píng)論:你們?nèi)ツ暝谑澜缛斯ぶ悄艽髸?huì)上展示了打麻將、商超打包這些長(zhǎng)程任務(wù),成功率很高。但今年4月發(fā)布的Psi-R2和Psi-W0,技術(shù)路線似乎從VLA轉(zhuǎn)向了世界模型。這個(gè)轉(zhuǎn)變是怎么發(fā)生的?
王啟斌:我們是國(guó)內(nèi)最早做長(zhǎng)程靈巧操作的。去年展示打麻將、商超打包,是長(zhǎng)程任務(wù)在語義層面做理解和規(guī)劃,主要靠語言模態(tài)。但今年我們看到,如何把人類數(shù)據(jù)揉進(jìn)去,如何在時(shí)空關(guān)系中做任務(wù)推理,世界模型很有優(yōu)勢(shì)。
今年4月發(fā)布的Psi-R2是策略模型,學(xué)"這件事該怎么做";Psi-W0是動(dòng)作條件型世界模型(AC-WM),推演"換種做法會(huì)怎樣"。Psi-W0在訓(xùn)練中加入了約30%的失敗樣本,讓模型不只學(xué)習(xí)成功軌跡,也理解失敗如何發(fā)生。

▎AI 科技評(píng)論:架構(gòu)上,Psi系列和之前的VLA是什么關(guān)系?替代還是融合?
王啟斌:主要是替代了舊的VLA架構(gòu)。但從輸入輸出看,它們本質(zhì)可以交互——輸入有視頻、語言、機(jī)器人狀態(tài),輸出有機(jī)器人動(dòng)作和對(duì)未來狀態(tài)的預(yù)測(cè)。我們現(xiàn)在的架構(gòu)是基于10萬小時(shí)人類數(shù)據(jù)預(yù)訓(xùn)練的World Action Model(WAM),這在行業(yè)里正成為共識(shí)性技術(shù)路線。
▎AI 科技評(píng)論:10萬小時(shí)人類數(shù)據(jù)是怎么采的?行業(yè)里有仿真數(shù)據(jù)、遙操作數(shù)據(jù)、UMI夾爪數(shù)據(jù),你們?yōu)槭裁磮?jiān)持自研手套采人類五指數(shù)據(jù)?
王啟斌:去年下半年開始,我們自研穿戴式多模態(tài)數(shù)據(jù)手套,在北京建了數(shù)據(jù)工廠。手套捕捉視覺、觸覺、關(guān)節(jié)角,3D軌跡精度達(dá)亞毫米級(jí)。

這里有個(gè)對(duì)數(shù)據(jù)的洞察能力。人類數(shù)據(jù)是個(gè)金字塔:純第一人稱視角視頻容易出現(xiàn)遮擋,多攝像頭又很難搬到真實(shí)場(chǎng)景。更重要的是,純視頻數(shù)據(jù)精度不夠。有人說純視頻能做到毫米級(jí),但那更多是偏靜態(tài)的、很慢的動(dòng)作。操作有很多高頻節(jié)拍非常快,基于視頻的東西在這么高動(dòng)態(tài)情況下,怎么做到毫米級(jí)?
我們加了關(guān)節(jié)角和觸覺,做到亞毫米級(jí)數(shù)據(jù)。原來模型能做的事,現(xiàn)在涌現(xiàn)出來的能力更強(qiáng)。比如疊紙盒子,每次折疊形變都不一樣;手機(jī)盒鉸鏈、微波爐處理,基礎(chǔ)模型能力明顯不同。
▎AI 科技評(píng)論:成本呢?10萬小時(shí)聽起來很貴。
王啟斌:通過手套采集的綜合成本,可以降至真機(jī)遙操作方案的十分之一。我們計(jì)劃推出便攜式眾包版本,讓成本進(jìn)一步下降。今年和明年,數(shù)據(jù)采集系統(tǒng)包括云端服務(wù),是靈初很重要的商業(yè)化方向。

03
▎AI 科技評(píng)論:你們定位是通用靈巧操作的模型公司,但為什么又做整機(jī)PsiBot V1?行業(yè)里很多公司要么做純算法授權(quán),要么做本體硬件,你們?cè)趺聪氲模?/span>
王啟斌:我們叫"小全棧",不做移動(dòng),不碰核心零部件,但做整機(jī)設(shè)計(jì)和全棧軟件。這個(gè)選擇是被“逼”出來的。我們買過一些整機(jī)硬件,發(fā)現(xiàn)底層軟件不開放,控制方式對(duì)我們強(qiáng)化學(xué)習(xí)不友好,很難做到系統(tǒng)最優(yōu)。
具身模型和語言模型完全是兩回事。語言模型跑在標(biāo)準(zhǔn)化的服務(wù)器上,硬件底層是統(tǒng)一的;但具身模型必須直接操控物理世界,從算法到真機(jī)之間,隔著巨大的物理動(dòng)態(tài)鴻溝(dynamics gap)。不同機(jī)器人的關(guān)節(jié)結(jié)構(gòu)、傳感器分布、質(zhì)量慣性全都不一樣。換句話說,在這個(gè)行業(yè),連打造一臺(tái)軟硬件深度耦合的專用整機(jī)(類似iPhone模式)都極富挑戰(zhàn),更遑論讓同一個(gè)foundation model像安卓那樣去適配成百上千種形態(tài)各異的硬件。所以一兩年內(nèi),我非常看衰純算法授權(quán)這種模式。
▎AI 科技評(píng)論:但做整機(jī)很重。
王啟斌:我們硬件是定制后找代工,軟件全棧自研。因?yàn)橛?xùn)模型出身,我們對(duì)數(shù)據(jù)的洞察很深,知道為什么純視頻數(shù)據(jù)很難做到后面這些東西。這是靈初最核心的定位。我們錨定在通用靈巧操作的模型公司,但因?yàn)橐?xùn)模型,所以知道數(shù)據(jù)怎么采;因?yàn)椴蓴?shù)據(jù),所以知道整機(jī)怎么看透。
▎AI 科技評(píng)論:怎么看今年上半年的具身市場(chǎng)?出貨量好像越來越往頭部集中,您覺得具身行業(yè)該如何卡位?
王啟斌:出貨量集中說明行業(yè)到了決賽圈,但現(xiàn)在的競(jìng)爭(zhēng)本質(zhì)還是全棧競(jìng)爭(zhēng)。大家比拼的是整套系統(tǒng)能不能跑通,成功率、節(jié)拍、能不能穩(wěn)定工作一整天。模型、數(shù)據(jù)、硬件形態(tài)現(xiàn)在還是深度綁定的,誰也解不了耦。(雷峰網(wǎng)(公眾號(hào):雷峰網(wǎng)))
這也是我們堅(jiān)持"小全棧"的原因。靈初本質(zhì)上是一家通用靈巧操作的模型公司,但我們必須對(duì)整機(jī)有穿透力。因?yàn)槟P褪俏覀冏约河?xùn)出來的,所以我們知道純視頻數(shù)據(jù)為什么不夠、為什么需要亞毫米級(jí)的關(guān)節(jié)角和觸覺;反過來,數(shù)據(jù)的采集又讓我們對(duì)硬件該往哪走看得很透。從2026年往回看,很多硬件基因很強(qiáng)的團(tuán)隊(duì),在模型側(cè)和數(shù)據(jù)側(cè)反而缺乏這種從訓(xùn)練里長(zhǎng)出來的體感。
但我預(yù)判,這種"每家都必須做全棧"的狀態(tài)大概還會(huì)維持兩年左右。兩年后行業(yè)會(huì)慢慢分化:有人專門做本體代工,有人深耕運(yùn)控,有人做操作模型和系統(tǒng)集成,生態(tài)位重新分層。到那時(shí)候,靈初的位置會(huì)很清楚:我們是做通用靈巧操作的模型公司,手里握著從數(shù)據(jù)采集到模型訓(xùn)練的全套能力,只做輪式加雙臂這個(gè)形態(tài),把操作這件事做透。

04
▎AI 科技評(píng)論:你們?yōu)槭裁床蛔黾彝?chǎng)景?今年很多創(chuàng)業(yè)公司都在拼命切入這個(gè)賽道。
王啟斌:家庭場(chǎng)景泛化性要求最高,但節(jié)拍可以慢;工業(yè)流水線泛化性最弱,但節(jié)拍最快。我們選的是中間態(tài):物流、零售、服務(wù)場(chǎng)景,泛化性適中,節(jié)拍適中。家庭要做到很通用,還是比較挑戰(zhàn),得拆細(xì)了看。工業(yè)場(chǎng)景我們也在看3C和汽車,但純流水線的節(jié)拍算賬很難。
▎AI 科技評(píng)論:今年以來很多智駕背景的公司也在切入具身,對(duì)比你做L4無人車的時(shí)間點(diǎn),他們比你轉(zhuǎn)向晚了近兩年,你有什么具身心得可以跟他們分享?
王啟斌:智駕有更大市場(chǎng),但具身比智駕更復(fù)雜。智駕的核心是讓機(jī)器在結(jié)構(gòu)化環(huán)境里跑起來,無論是從酒店走廊還是城市公開道路。從智駕轉(zhuǎn)過來,有個(gè)最大的慣性是覺得"底盤和感知我搞定了,具身不就是加個(gè)機(jī)械臂嗎?"這個(gè)認(rèn)知陷阱很深。
車的線控底盤是相對(duì)標(biāo)準(zhǔn)的,一個(gè)車型平臺(tái)可以跑幾十萬輛車,傳感器布局、質(zhì)量慣性、控制接口都是固定的。但具身智能面對(duì)的是完全不同的物理世界,是上半身操作,一個(gè)靈巧手就有二十多個(gè)自由度,雙臂協(xié)同加上輪式底盤,整個(gè)系統(tǒng)五六十個(gè)自由度。你在智駕里訓(xùn)練的那個(gè)模型,處理的是路面上的預(yù)測(cè)和規(guī)劃;到了具身,你要處理的是軟體變形、鉸鏈開合、接觸力控,這些dynamics gap比車與車之間的差異大一個(gè)數(shù)量級(jí)。
▎AI 科技評(píng)論:感悟和建議呢?
我的第一個(gè)感悟是:不要低估從"移動(dòng)智能"到"操作智能"的鴻溝。你在智駕積累的數(shù)據(jù)管線、仿真能力、車隊(duì)運(yùn)營(yíng)經(jīng)驗(yàn),確實(shí)可以復(fù)用一部分,但物理交互的復(fù)雜度完全不同。我們?nèi)ツ觊_始自研多模態(tài)數(shù)據(jù)手套,就是因?yàn)榘l(fā)現(xiàn)純視覺數(shù)據(jù)在動(dòng)態(tài)操作精度上根本不夠用,智駕的攝像頭可以拍清楚一百米外的車道線,但機(jī)器人疊一個(gè)紙盒子,需要亞毫米級(jí)的關(guān)節(jié)角和觸覺反饋,這是兩套數(shù)據(jù)邏輯。
第二個(gè)感悟是時(shí)間窗口的殘酷性。我在京東做無人車時(shí),那波L4配送的戰(zhàn)爭(zhēng)基本上已經(jīng)打完了,頭部格局很清晰。具身這波不一樣,它還在早期,但窗口期比智駕更短。因?yàn)榇竽P捅l(fā)得太快,2024年大家還在爭(zhēng)論VLA路線,2025年已經(jīng)在卷世界模型和人類數(shù)據(jù)了。如果你還帶著智駕的周期思維,先花兩年打磨硬件平臺(tái),再花兩年上算法,等你的整機(jī)ready,模型范式可能已經(jīng)換了兩代。
第三個(gè)感悟可能更直接,上來不要想做通用平臺(tái)。具身領(lǐng)域,模型和硬件的耦合深度遠(yuǎn)超自動(dòng)駕駛。靈初選擇做"小全棧",只做輪式加雙臂,不碰核心零部件,但整機(jī)設(shè)計(jì)和底層軟件全自己抓,就是為了能跑快速跑強(qiáng)化學(xué)習(xí)做驗(yàn)證。
所以要給建議,就是先找一個(gè)窄切口扎進(jìn)去。智駕的市場(chǎng)邏輯是贏家通吃,因?yàn)榈缆肥菢?biāo)準(zhǔn)化的,具身的市場(chǎng)邏輯是垂直深耕,先把一種硬件形態(tài)、一類操作任務(wù)做閉環(huán),比做一個(gè)"適配所有機(jī)器人的安卓系統(tǒng)"要?jiǎng)?wù)實(shí)得多。操作才是具身皇冠上的明珠,移動(dòng)只是入場(chǎng)券。在操作上,我們很快會(huì)在工業(yè)客戶現(xiàn)場(chǎng)看到更真實(shí)的驗(yàn)證。
▎AI 科技評(píng)論:你們今年還有什么計(jì)劃?
王啟斌:六七月份,會(huì)發(fā)基于更大幾十萬小時(shí)數(shù)據(jù)的模型,做更長(zhǎng)程、更泛化的任務(wù)。年底會(huì)做到類似π0.7的語言操控能力,你給機(jī)器人一句很粗放的自然語言,它就能做很長(zhǎng)程的任務(wù),而且會(huì)出現(xiàn)沒見過場(chǎng)景中自己涌現(xiàn)的技能組合。這既是技術(shù)秀肌肉,也是服務(wù)產(chǎn)業(yè)的真實(shí)需求,普通人能操作了。
▎AI 科技評(píng)論:這需要多少數(shù)據(jù)?
王啟斌:我們今年目標(biāo)是百萬小時(shí)級(jí)人類數(shù)據(jù)。通用操作能力的涌現(xiàn)需要百萬小時(shí)起步,億小時(shí)級(jí)是終極目標(biāo)。(雷峰網(wǎng))
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。