0
| 本文作者: 鄭佳美 | 2026-06-30 22:33 |
6月29日,在中國信通院人工智能軟硬件協(xié)同創(chuàng)新與適配驗證中心、中國人工智能產(chǎn)業(yè)發(fā)展聯(lián)盟、工信部人工智能標(biāo)準(zhǔn)化技術(shù)委員會聯(lián)合主辦的2026“眾智”大模型開放智算生態(tài)協(xié)同高級別研討會中,中國信通院副院長魏亮,正式發(fā)布AISHPerf人工智能軟硬件基準(zhǔn)體系3.0版本,包含兩項 AI Infra 領(lǐng)域核心評測基準(zhǔn)——AISHPerf-智算運維智能體評測基準(zhǔn)以及AISHPerf-算子生成智能體評測基準(zhǔn),兩大基準(zhǔn)由國內(nèi)頂尖AI原生基礎(chǔ)設(shè)施服務(wù)商無問芯穹及清華大學(xué)團隊作為重點技術(shù)支持方參與建設(shè)。
前者是首個面向 AI Infra 的運維智能體評測基準(zhǔn),依托百億級真實運維數(shù)據(jù)構(gòu)建,核心考核智算運維智能體在真實生產(chǎn)場景中解決實際問題的落地能力。后者則跳出 “模型能否生成可運行 GPU 算子” 的基礎(chǔ)維度,將評測重心錨定在 “模型生成的算子能否在真實量化推理部署中替代現(xiàn)有算子” 的工程可部署性上,更貼合產(chǎn)業(yè)實際落地需求。二者從底層算力優(yōu)化到上層集群運維,共同為智算產(chǎn)業(yè)的標(biāo)準(zhǔn)化升級與高質(zhì)量發(fā)展提供了統(tǒng)一的能力參照框架。

AISHPerf(Performance Benchmarks of Artificial Intelligence Software and Hardware)是中國信通院與人工智能大模型及軟硬件評測工業(yè)和信息化部重點實驗室,依托人工智能軟硬件協(xié)同創(chuàng)新與適配驗證中心(位于國家信創(chuàng)園)聯(lián)合構(gòu)建的人工智能軟硬件基準(zhǔn)體系,旨在設(shè)置多維度指標(biāo),考察端到端方案對模型及應(yīng)用場景的真實承載能力,系統(tǒng)評估軟硬件各層級間的協(xié)同優(yōu)化水平、兼容適配能力及整體交付效能。
在此次發(fā)布的兩項基準(zhǔn)中,AISHPerf-智算運維智能體評測基準(zhǔn)尤為引人注目,它不僅標(biāo)志著我國在智算集群運維智能體領(lǐng)域擁有了首個權(quán)威評測體系,更率先將國產(chǎn)芯片集群運維場景納入評測體系、填補了國產(chǎn)智算運維智能體評測領(lǐng)域的空白,為構(gòu)建自主自治的新一代“Token工廠”提供了運維領(lǐng)域的技術(shù)方向與標(biāo)準(zhǔn)指引。
構(gòu)建新標(biāo)準(zhǔn):基于近百億條真實運維數(shù)據(jù)構(gòu)造,從“紙上談兵”到“實戰(zhàn)考核”
隨著AI發(fā)展從“堆算力、拼規(guī)模”邁入以“Token效能”為核心的新階段,算力與電力投入已成為AI基礎(chǔ)設(shè)施的“基礎(chǔ)常量”,高效率、高質(zhì)量的運維能力,則是決定Token產(chǎn)出與生產(chǎn)力轉(zhuǎn)化的“核心變量”。依托智能運維提升算力利用效率、壓降運營成本,已是 AI 產(chǎn)業(yè)發(fā)展的必然方向。而當(dāng)前業(yè)內(nèi)對運維智能體的評估多停留在語言問答能力層面的“紙上談兵”,往往更像是筆試,側(cè)重考察知識記憶與標(biāo)準(zhǔn)答案復(fù)述,而缺乏針對真實運維場景的“實戰(zhàn)考核”,無法反映智能體“能否解決實際問題”。
AISHPerf-智算運維智能體評測基準(zhǔn)正是一套錨定真實生產(chǎn)場景的實操型評測體系。它以無問芯穹沉淀的近百億條真實運維數(shù)據(jù)為底座,經(jīng)資深運維專家脫敏并精細(xì)標(biāo)注和嚴(yán)格篩選,最終抽象提煉出 103 條高保真、高質(zhì)量的典型評測用例;同時打通從底層硬件故障到用戶側(cè)軟件 Bug 的全鏈路問題,構(gòu)建起覆蓋5大技術(shù)棧、44種問題現(xiàn)象、22個細(xì)分故障領(lǐng)域、3種難度層級、6種國內(nèi)外芯片(其中5種為國產(chǎn)芯片)的立體化科學(xué)評測體系。評測流程中不明確指出故障根因,只提供真實的集群環(huán)境和有限的問題現(xiàn)象描述,要求智能體完成自主探索、自主排查和自主修復(fù)。最終輸出時延、Token消耗、工具調(diào)用效率等關(guān)鍵維度的量化結(jié)果,全面客觀地評估運維智能體在真實生產(chǎn)環(huán)境中端到端解決問題的能力。
促進新發(fā)展:五種國產(chǎn)芯片覆蓋,為國產(chǎn)算力集群從“能用”邁向“好用”提供標(biāo)準(zhǔn)基礎(chǔ)
作為我國智算產(chǎn)業(yè)自主可控的核心底座,國產(chǎn)芯片近年來實現(xiàn)了從 “跟跑” 到部分領(lǐng)域 “并跑” 的關(guān)鍵跨越,已成為全國算力基礎(chǔ)設(shè)施體系的核心組成部分。據(jù) IDC 統(tǒng)計,2025 年中國市場 AI 加速卡國產(chǎn)化率已突破四成,國產(chǎn) GPU 集群規(guī)模進入快速擴容期。但相較于成熟的通用 GPU 生態(tài),國產(chǎn)芯片在硬件架構(gòu)、驅(qū)動體系、通信協(xié)議及框架適配等層面存在顯著技術(shù)差異,運維復(fù)雜度與難度更大,直接制約國產(chǎn)算力的 Token 產(chǎn)出效率與投產(chǎn)效益,成為國產(chǎn)算力從 “規(guī)模落地” 向 “效能釋放” 進階的核心瓶頸。
AISHPerf-智算運維智能體評測基準(zhǔn)在設(shè)計之初便深度融入了對國產(chǎn)化生態(tài)的考量,率先在同類評測基準(zhǔn)中納入包括“天數(shù)、壁仞、沐曦、摩爾、昇騰”5 種國產(chǎn)芯片集群運維的特定場景及典型問題測例,覆蓋國產(chǎn) GPU 硬件故障、驅(qū)動適配、框架兼容、通信協(xié)議等典型運維痛點,首次為國產(chǎn)智算運維智能體建立起統(tǒng)一、可量化的評估標(biāo)尺,填補了國產(chǎn)智算運維領(lǐng)域的標(biāo)準(zhǔn)空白。

未來,中國信通院將持續(xù)從標(biāo)準(zhǔn)研制、測試驗證、生態(tài)培育等方面推動基準(zhǔn)產(chǎn)業(yè)應(yīng)用,結(jié)合無問芯穹海量真實運維數(shù)據(jù)積累與智算運維技術(shù)實戰(zhàn)能力,不斷豐富國產(chǎn)芯片相關(guān)評測用例,構(gòu)建更加體系化、全棧化的國產(chǎn)智算運維評測體系,一方面精準(zhǔn)定位國產(chǎn)芯片集群運維的共性痛點與工程難點,牽引產(chǎn)業(yè)鏈上下游協(xié)同攻關(guān)、補短板強弱項;另一方面以標(biāo)準(zhǔn)化評測驅(qū)動運維智能化能力升級,推動國產(chǎn)算力集群真正實現(xiàn)從 “能用” 到 “好用、高效、穩(wěn)產(chǎn)” 的質(zhì)變,為我國智算產(chǎn)業(yè)自主可控與高質(zhì)量發(fā)展筑牢底層標(biāo)準(zhǔn)支撐。
錨定新趨勢:指引AI基礎(chǔ)設(shè)施向自主自治的“Token工廠”升級
運維智能體的深度應(yīng)用,正在推動 AI 基礎(chǔ)設(shè)施自身向“智能體”形態(tài)升級。未來的 AI 基礎(chǔ)設(shè)施,將是能夠自我感知、自我修復(fù)、自我迭代的自主自治系統(tǒng)。內(nèi)置的運維智能體將以“管理者”的角色,根據(jù)訓(xùn)練與推理需求自動調(diào)度資源、優(yōu)化系統(tǒng),實現(xiàn)算法與基礎(chǔ)設(shè)施的深度協(xié)同。去年以來,無問芯穹已在推理訓(xùn)練業(yè)務(wù)中率先部署運維智能體,使工單平均處理時間縮短 50%,關(guān)鍵故障處理效率提升約 6 倍,使綜合運維成本下降了約 30%,在算力和電能不變的前提下,實現(xiàn)了 Token 產(chǎn)能的顯著提升。
AISHPerf-智算運維智能體評測基準(zhǔn)將為 AI 基礎(chǔ)設(shè)施向更高階的“自主自治”范式演進奠定標(biāo)準(zhǔn)基礎(chǔ)。通過統(tǒng)一的評測體系,為構(gòu)建高效、穩(wěn)定、自主的智能運維體系提供指導(dǎo),加速運維智能體在 AI 基礎(chǔ)設(shè)施中的規(guī)模化應(yīng)用,實現(xiàn) Token 產(chǎn)能的降本增效,讓每一度電、每一張 GPU 卡都能產(chǎn)出更多更高價值的 Token,助力打造持續(xù)輸出高質(zhì)量、大規(guī)模、高效率AI生產(chǎn)力的“Token工廠”。
未來,中國信通院與無問芯穹、清華大學(xué)將深化產(chǎn)學(xué)研協(xié)同,迭代優(yōu)化 AISHPerf-智算運維智能體評測基準(zhǔn),不斷擴充場景覆蓋維度、豐富數(shù)據(jù)集規(guī)模、提升評測結(jié)果的可靠性與權(quán)威性,推動其成為行業(yè)公認(rèn)的 AI 集群運維智能體能力評估公共基線,牽引全行業(yè)優(yōu)質(zhì)運維智能體的技術(shù)迭代與規(guī)模化落地。與此同時,雙方也將持續(xù)拓展 AI Infra 全領(lǐng)域核心評測基準(zhǔn)布局,構(gòu)建起全棧的標(biāo)準(zhǔn)矩陣,為建設(shè)高效、綠色、自治的新一代 AI 基礎(chǔ)設(shè)施筑牢標(biāo)準(zhǔn)底座,助力我國智算產(chǎn)業(yè)穩(wěn)步邁向高質(zhì)量發(fā)展新階段。
開源地址:https://gitee.com/aishperf-caict/aishperf_openness
配套故障模擬器:https://gitee.com/aishperf-caict/aishperf_openness/tree/main/entities/aiops-chaos
運維數(shù)據(jù)集:https://gitee.com/aishperf-caict/aishperf_openness/blob/main/entities/datasets/aiops-eval-prompts.jsonl
評測框架:https://gitee.com/aishperf-caict/aishperf_openness/tree/main/suites/aiops-eval