0

把一臺能運行122B大模型的AI主機塞進口袋,需要付出什么代價?
過去大半年,端側AI硬件的邏輯正在發生變化。
兩個月前,國內掀起一場現象級的本地部署Agent熱潮,大量AI愛好者開始“養蝦”,讓原本偏小眾的Mac mini意外出圈,一度出現溢價和缺貨。在更硬核的開發者圈子里,三四萬元的英偉達DGX Spark同樣熱度不低,因為它已經能夠在本地運行千億參數模型。
Mac mini和DGX Spark同時走紅,背后其實指向的是同一個趨勢:Agent正在迅速抬高端側AI硬件的門檻。
此前,40TOPS級別的AI PC,僅能完成對話、生成等輕量任務。但進入Agent時代后,開發者開始追求更大的模型、更長時間的本地推理,以及真正能夠承擔生產力任務的端側AI設備。
問題隨之出現。Mac mini足夠安靜、低功耗,卻很難支撐更大的本地模型;DGX Spark擁有強悍性能,但價格、功耗與散熱,又很難真正走向大眾化。大算力、低功耗與小體積之間,似乎始終難以兼得。
Agent時代真正缺少的,不再只是一臺更強的AI PC,而是一種能夠7×24小時運行、低功耗、安靜,并具備本地執行能力的新終端。
一種介于AI PC與AI工作站之間的Agent Computer出現了。最近發布的聯想AI主機P7,僅300克、30W功耗的設備,擁有190TOPS端側AI算力,能在本地運行122B參數模型。
AI 2.0時代,需要怎樣的Agent Computer?
傳統AI更多還是一問一答式交互,任務結束后,模型也隨之停止運行。但Agent不同,它需要長期在線、持續調用模型、自主拆解任務,并在本地完成記憶、推理、執行等一整套過程。
這意味著Agent設備比拼的,不再只是瞬時性能,而是長期穩定運行能力。
換句話說,AI 2.0時代真正需要的不是AI PC的簡單升級版,而是一種介于AI PC與AI工作站之間的新終端,它既要具備運行大模型的能力,又必須兼顧低功耗、靜音、小體積,以及7×24小時持續工作的穩定性。
聯想AI主機P7,正是在AI 2.0需求下誕生的Agent Computer新物種。它既嘗試接近DGX Spark的大模型生產力能力,又保留了類似Mac mini的低功耗與靜音特性。

P7擁有190TOPS異構AI算力(dNPU+SoC),其中160TOPS來自后摩漫界M50 dNPU,30TOPS來自此芯P1 SoC。整機最高支持122B參數模型本地部署,最高可配置80GB RAM,并支持128K上下文窗口。
在無網環境下,P7本地自主推理速度最高可達50 Tokens/s,可以實現7×24小時連續執行Agent任務。
圍繞Agent長期在線需求,P7的機身只有手掌大小,重量約300克,甚至可以直接通過充電寶供電運行。為了在小體積下實現持續穩定運行,P7還將整機功耗控制在30W以內,并將運行噪音壓低至35分貝以下。
這意味著,聯想AI主機P7已經開始真正具備本地生產力價值。
更重要的是,與傳統PC+AI的思路不同,P7并不是在原有設備中增加AI功能,而是圍繞Agent場景重新定義終端邏輯。
例如,P7采用了一機雙模設計,在智能體模式下,本地運行天禧Claw,將復雜任務盡可能留在本地執行;在大模型模式下,則通過開放API Key接入各類AI應用與智能體,直接承擔本地推理與Token生成能力。
P7的推出代表著過去只有高功耗工作站才能承擔的大模型本地推理能力,開始有機會進入更低功耗、更低成本的小型設備。
而只有當大模型推理能夠在低功耗、小體積條件下長期運行,Agent才有可能真正從少數開發者設備,逐漸走向更廣泛的消費級與行業終端場景。
支撐這種Agent Computer形態成立的,是P7背后一套不同于傳統GPU路線的新算力方案。
千億模型裝進口袋之后,算力邏輯也變了
聯想在P7立項初期就已經明確,要做一臺能放進口袋、又能本地運行大模型的AI主機。這意味著它的芯片必須同時滿足三個幾乎互斥的條件:大算力、低功耗、小體積。
傳統AI芯片很難同時兼顧這些需求,核心在于數據搬運——計算單元與存儲單元物理分離,數據在兩者之間頻繁流動,帶來額外的能耗與延遲。
AI芯片行業因此不斷探索新的架構路徑,其中一個正在被越來越多廠商探索的方向就是存算一體,存算一體讓數據在存儲側就近完成計算,從而減少搬運開銷,提升整體能效。
聯想選擇引入存算一體架構芯片,作為P7的主要AI算力來源,也就是dNPU(Discrete NPU),它類似于獨立GPU的定位,擁有更強的AI性能。
這顆dNPU,正是后摩智能在2025年推出的存算一體AI芯片——后摩漫界M50。
后摩漫界M50采用存算一體架構設計,具備160TOPS物理算力,配備最高48GB內存與153.6GB/s帶寬,典型功耗僅10W,能效達到傳統架構芯片的5~10倍。

雷峰網了解到,M50在設計階段就針對大模型部署進行了優化,通過SRAM與48GB LPDDR5的組合方案,在兼顧性能的同時,提升了千億參數模型的可部署性與成本可控性。
真正的挑戰不止于芯片,而是如何讓千億參數模型在一臺300克級別的設備上長期穩定運行。這需要聯想與后摩智能在本地Agent系統、推理框架以及軟硬件協同層面進行深度配合。
尤其是在Agent執行鏈路、模型調度與端側資源管理上,聯想需要一套全新的系統能力來支撐持續運行的AI任務。
從2025年下半年項目正式啟動開始,聯想與后摩智能組建聯合團隊,圍繞硬件設計、軟件適配與推理框架展開了長達十多個月的聯合攻堅,最終實現了在后摩漫界M50上運行千億參數大模型。
目前,P7已經支持千問、智譜、DeepSeek等主流模型,并可實現新模型的Day0適配,即模型發布當天即可完成運行支持。對于用戶而言,這使得P7不再只是演示型設備,而是一臺可長期運行Agent任務的本地AI終端。
從芯片到系統,再到Agent執行能力,聯想與后摩智能正在共同驗證一種新的AI主機形態。
隨著端側大模型持續演進,這種兼顧性能、功耗與長期運行能力的Agent Computer,正在成為AI 2.0時代最具現實落地潛力的終端方向之一。
Agent 浪潮重構硬件規則,存算一體迎來推理黃金時代
AI芯片的競爭邏輯,正在發生一場靜默的翻轉。
過去幾年,行業的核心指標是峰值算力,比拼的是誰能訓練更大的模型,GPU也因此成為整個AI時代的核心基礎設施。
但當AI從1.0時代的生成一次回答走向2.0時代的長期運行、持續執行任務的Agent形態后,芯片的評價體系開始變化:能效比、持續推理能力、本地執行復雜任務的穩定性,逐漸與峰值算力同等重要。
這一變化并不是傳統AI芯片的優勢所在,卻為新的架構路徑打開了窗口。
一個明顯的信號來自行業巨頭。英偉達重金收購初創公司 Groq 核心技術資產,將其 LPU (Language Processing Unit)語言處理單元用于高性能推理場景。后摩智能與Groq都是存算一體技術路線,都是基于SRAM設計產品,減少數據搬運、提升推理能效,只是產品叫法不同。
后摩智能在成立之初就專注于存算一體技術的研發與產業化,2024年推出針對大模型推理優化的后摩漫界M30,支持運行60億參數模型,并獲得了中國移動等客戶。
目前,基于后摩漫界M50,后摩智能已經搭建起M.2卡、DM.2卡、Pcie卡,最高 640TOPS 算力的完整產品矩陣,并完成了從技術原型到規模化商用的關鍵跨越。如今后摩漫界M50已全面落地聯想AI主機P7、 AI PC、桌面機器人、Agent Box、智能語音終端、AI 網關等多元端邊場景。
后摩智能也在研發下一代芯片,目標是進一步提升能效比與大模型推理能力,以適配未來更復雜的Agent時代。
這是一個標志性的轉折點,GPU 定義了大模型訓練時代,而 Agent 的全面爆發,正將算力競爭從云端訓練中心,推向海量的端側、邊緣推理節點。在這場算力格局遷移中,以存算一體為代表的 AI 原生架構,不再只是 GPU 的補充或替代,更在逐步建立端側 Agent 時代的全新硬件標準。
隨著Agent開始向更多本地設備滲透,行業對于低功耗、高能效端邊推理芯片的需求也會持續增加。
未來,圍繞端側大模型推理,還會出現更多新的芯片形態與架構路線。
在這場Agent驅動的AI硬件范式切換中,AI原生的芯片成為競爭的關鍵,像后摩智能這樣率先完成存算一體商業化落地的公司,正在進入更大的增長通道。
更多關于推理時代算力需求的深度交流歡迎添加作者微信BENSONEIT。雷峰網(公眾號:雷峰網)雷峰網
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。