0
進入AI推理時代,一個核心的問題是AI如何大規(guī)模落地?這就不可避免地要回答云端AI和端側(cè)AI的協(xié)同問題。
“如果完全依賴云端,它或許能成為極其強大的生產(chǎn)力工具,但很難成為一個有溫度、真正理解個人的AI智能體。”高通公司產(chǎn)品技術(shù)專家朱元堃說。

高通公司產(chǎn)品技術(shù)專家朱元堃
這句話點出了端側(cè)AI最核心的價值,也劃開了生產(chǎn)力工具與個人AI之間的邊界。
云端模型擁有強大的算力和豐富的公共知識,可以快速回答問題、生成內(nèi)容、完成復雜任務。但一個真正理解用戶的個人AI,還需要知道這個人是誰、身處什么環(huán)境、過去做過什么以及此刻想要什么。
這些信息不在云端,而在離用戶最近的手機、PC、智能眼鏡和可穿戴設備里。
近日,在財新圓桌-AI系列“智能體時代終端產(chǎn)業(yè)的下一站”活動上,由高通公司委托,全球著名信息技術(shù)與消費科技咨詢顧問公司IDC獨立開展研究的《從AI設備到個人AI:智能體驅(qū)動的終端進化與產(chǎn)業(yè)重構(gòu)》白皮書正式發(fā)布。IDC將當前的產(chǎn)業(yè)變化稱為“AI超級大周期”。

IDC中國副總裁王吉平
IDC中國副總裁王吉平表示,傳統(tǒng)終端市場承壓的同時,智能眼鏡、Mini PC、錄音卡等新型終端正在增長。
王吉平認為,終端產(chǎn)業(yè)的增長邏輯也正在改變。過去的AI for device,是在手機、PC等既有設備上增加圖片處理、文檔總結(jié)等單點功能;AI for user則要以智能體為核心,圍繞同一個用戶調(diào)度不同終端和算力。
“個人AI是以智能體為核心運行載體、以用戶為中心展開運行的智能系統(tǒng)。”王吉平說。終端產(chǎn)業(yè)也將從單一設備的智能化,轉(zhuǎn)向分布式的端、邊、云協(xié)同,競爭維度則從硬件參數(shù)進一步擴展到軟硬件與AI服務的一體化能力。
當越來越多終端擁有數(shù)十TOPS算力,真正的個人AI為什么依然沒有出現(xiàn)?
核心要跨過三道坎,從“能算”到“懂你”,從“跑起來”到“一直在線”,再從設備互聯(lián)走向智能體圍繞用戶自由流轉(zhuǎn)。
云端讓AI更強,端側(cè)讓AI真正懂你
過去幾年,行業(yè)談論端側(cè)AI,通常指在手機或者PC上運行一個本地模型。模型可以完成圖片處理、文本總結(jié)或文檔生成,這只是AI for device——設備增加了AI功能,并不意味著它已經(jīng)成為個人AI。
個人AI的核心差異是“上下文”。
朱元堃指出,完整的智能體體驗包含感知、記憶、推理和工具執(zhí)行四個部分。終端通過攝像頭、麥克風和各類傳感器感知周圍環(huán)境,把長期信息沉淀為個人記憶,再基于當下情境理解用戶意圖,最終調(diào)用應用、設備或云端服務完成任務。

感知與記憶,是云端最難獨立完成的兩個環(huán)節(jié)。云端可以擁有比終端更大的模型,卻無法天然獲得最實時、最連續(xù)的個人信息。完全依賴云端的AI可以成為強大的通用工具,但很難形成對某一個人的長期理解。
因此,端側(cè)AI也不是云端AI的縮小版。
云端面對的是大量用戶提交的復雜計算任務,端側(cè)主要服務于單個用戶。云端擅長調(diào)用大模型和公共知識,端側(cè)負責實時感知、個人記憶與隱私數(shù)據(jù)。二者不是相互替代,而是根據(jù)任務、成本、時延和隱私要求動態(tài)分工。

“用戶最終在意的并不一定是絕對最快的答案,而是最符合自己需求的答案。即使響應時間稍長,用戶也愿意等,因為它真正懂我。”朱元堃說。
這也是“有溫度”背后的技術(shù)含義:AI不僅能給出正確答案,還要結(jié)合個人歷史和當前情境,給出適合這個用戶的答案。
但要讓終端持續(xù)理解用戶,僅有大模型和更高算力并不夠。
端側(cè)AI比TOPS更棘手的,是內(nèi)存和續(xù)航
TOPS曾經(jīng)是端側(cè)AI芯片最醒目的標簽。
隨著NPU算力不斷提升,單一峰值指標已經(jīng)越來越難解釋真實體驗。那端側(cè)AI是否仍應主要看TOPS?朱元堃表示,“算力依然是芯片選型的重要參考,但算力是基礎(chǔ),不是唯一標準。”
相比單項算力,高通更關(guān)注AI Benchmark的綜合表現(xiàn),包括首字時間、解碼速度、內(nèi)存占用和模型精度。只有硬件算力,沒有軟件、內(nèi)存與系統(tǒng)協(xié)同,峰值TOPS很難轉(zhuǎn)化為穩(wěn)定的用戶體驗。
更深層的變化在于,端側(cè)智能體面對的工作負載已經(jīng)不同。
云端推理通常從接收明確任務開始,持續(xù)執(zhí)行到任務完成。個人智能體則大部分時間處于感知狀態(tài),推理占比次之,真正執(zhí)行復雜任務的時間更少。它需要長期在線,卻不能讓攝像頭、麥克風和模型持續(xù)喚醒CPU與系統(tǒng)內(nèi)存。

這讓低功耗感知成為端側(cè)智能體的第一道工程難題。
驍龍移動平臺的傳感器中樞(Sensing Hub)正是為了應對數(shù)十毫安、甚至個位數(shù)毫安的應用場景,它從架構(gòu)設計上專注于超長續(xù)航和超低能耗的技術(shù)特征,從而能夠完成用戶場景的有效感知和識別。

傳感器中樞以Micro NPU、始終感知ISP、DSP和獨立內(nèi)存處理低功耗感知;CPU負責系統(tǒng)調(diào)度;Hexagon NPU承擔主要AI推理;調(diào)制解調(diào)器在需要時調(diào)用邊緣和云端能力。
這套異構(gòu)架構(gòu)的目標不是讓所有計算單元同時達到最高性能,而是根據(jù)不同負載,把任務放在能效最合適的單元上。
即便如此,端側(cè)最先撞上的仍然是內(nèi)存墻。
“端側(cè)智能體的主要問題其實還是內(nèi)存和續(xù)航的限制,而非性能的限制。”朱元堃對雷峰網(wǎng)(公眾號:雷峰網(wǎng))表示。
一方面,模型參數(shù)、個人記憶和上下文都需要占用內(nèi)存,終端又受到物理尺寸與成本限制;另一方面,端側(cè)模型在解碼階段需要反復讀取權(quán)重,內(nèi)存帶寬直接影響詞元生成速度。
高通正在探索3D內(nèi)存堆疊等技術(shù)路徑。即使不考慮全新的內(nèi)存架構(gòu),從LPDDR5X升級至LPDDR6,理論內(nèi)存帶寬也可以提升約50%。這意味著,當端側(cè)NPU算力繼續(xù)增長,內(nèi)存帶寬能否同步提升,將越來越直接地決定算力利用率。
另外,云端通過預填充與解碼分離,也就是PD分離,提高集群資源利用率,這并不適用于端側(cè)。朱元堃指出,端側(cè)預填充通常完成較快,解碼階段更容易受內(nèi)存帶寬限制,云端的資源調(diào)度方法不能被原樣照搬。
峰值算力決定智能體能做什么,內(nèi)存與功耗決定它能否每天持續(xù)工作。
設備互聯(lián)不難,難的是讓個人記憶安全流轉(zhuǎn)
如果個人AI只有一臺設備,它對用戶的理解依然是片面的。
手機知道用戶的位置和通信習慣,PC記錄工作流程,眼鏡看到用戶眼前的世界,耳機和手表則掌握聲音、運動與健康信息。設備越多,智能體獲得的上下文越完整。
這也是高通提出“所有設備都將成為智能體端點”的原因。基于統(tǒng)一的底層技術(shù)架構(gòu)和AI軟件棧,模型和應用可以在手機、PC、汽車、眼鏡等不同終端之間遷移,再根據(jù)各設備的性能、功耗、內(nèi)存和時延做出取舍。
跨終端覆蓋,正是高通成為個人AI時代領(lǐng)導力的關(guān)鍵。
王吉平表示:“高通的一大優(yōu)勢在于支持大量端側(cè)設備,不僅是手機,還有智能眼鏡、物聯(lián)網(wǎng)設備等。廣泛的端側(cè)設備基礎(chǔ),正是未來邊緣側(cè)發(fā)展的核心。”

與蘋果、谷歌通過操作系統(tǒng)和模型構(gòu)建縱向生態(tài)不同,高通是一條橫向平臺路線。從Oryon CPU、Adreno GPU、Hexagon NPU和傳感器中樞,到連接能力與統(tǒng)一AI軟件棧,高通為不同品牌、不同形態(tài)的終端提供一套共同的計算底座。
如果個人AI的終局是一套圍繞用戶運行的分布式系統(tǒng),競爭力就不再來自一顆NPU的峰值算力,而是能否同時提供計算、感知、連接和跨終端部署能力。以此衡量,高通已經(jīng)是個人AI底層計算平臺的領(lǐng)導者之一。

技術(shù)上的連接并非最難的一步。
“跨設備協(xié)同本質(zhì)上并不是一個技術(shù)問題,而是一個產(chǎn)業(yè)協(xié)同和生態(tài)共建的問題。”朱元堃說。通信產(chǎn)業(yè)有3GPP統(tǒng)一標準,不同廠商可以按照共同標準研發(fā);AI產(chǎn)業(yè)仍處于探索階段,跨品牌、跨操作系統(tǒng)和跨模型的協(xié)同規(guī)則尚未形成。
海外市場中,谷歌同時掌握Gemini和Android,蘋果也能在自己的軟硬件生態(tài)內(nèi)推動AI能力。國內(nèi)市場則有不同的手機品牌、操作系統(tǒng)和模型供應商,背后是更加復雜的利益鏈。
個人AI強調(diào)以用戶為中心,今天的終端生態(tài)卻仍然以廠商賬號、操作系統(tǒng)和品牌邊界為中心。
誰擁有用戶的長期記憶?誰決定哪些上下文可以在不同設備之間流轉(zhuǎn)?用戶更換手機品牌后,個人智能體能否繼續(xù)認識他?模型廠商、OEM、操作系統(tǒng)和芯片平臺,誰會掌握個人AI最重要的入口?
這些問題比連接協(xié)議更難回答。
“有溫度”也存在另一面。個人AI越想理解用戶,就越需要持續(xù)感知攝像頭、麥克風、位置和行為信息,這些恰好也是最敏感的個人數(shù)據(jù)。
“從用戶買單的角度來看,交互能力是最關(guān)鍵的,也就是全感知的交互體驗,這是用戶當下最迫切的需求。而最大的短板,我認為是安全問題。”王吉平說。

全時感知既是個人AI區(qū)別于傳統(tǒng)AI應用的核心價值,也是產(chǎn)業(yè)必須跨過的信任門檻。端側(cè)計算能夠減少敏感數(shù)據(jù)上傳云端,卻不等于自動解決了隱私問題。如果用戶無法控制設備記住什么、調(diào)用什么以及向誰共享,持續(xù)感知就可能從個性化能力變成新的風險源。
芯片算力讓個人AI具備了運行的可能,低功耗感知、內(nèi)存與軟件協(xié)同決定它能否持續(xù)工作,跨設備生態(tài)和數(shù)據(jù)權(quán)利則決定它最終屬于廠商,還是屬于用戶。
真正的個人AI,不是知道用戶越多越好,而是用戶能夠決定它知道什么、記住什么,以及把什么交給云端。
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。