0
| 本文作者: 叢末 | 2026-08-06 14:19 | 專題:IJCAI:國際人工智能聯合會議 |

作者丨幸麗娟
編輯丨齊鋮湧
IJCAI-ECAI 2026 將于 2026 年 8 月 15 日至 21 日在德國不來梅舉行。作為 AI 領域的綜合性頂級會議,IJCAI 一直是檢驗各大廠過去一年前沿研究成果的關鍵考場:誰在哪個方向上有真進展,哪些技術路線正在形成共識,論文是最直接的答案。
大會召開之際,AI科技評論也正在系統掃描本屆頂會收錄的論文,從中捕捉技術趨勢和行業風向。
一個清晰的趨勢是:AI 算力成本居高不下,而參數規模擴張帶來的邊際收益早已追不上邊際成本。這個經濟學現實正在重塑技術創新邏輯——從"能不能做得更大"轉向"能不能用得更省"。
華為被 IJCAI 2026 收錄的四篇論文,為這一轉向提供了技術路徑參考:用更精巧的架構設計和訓練策略,來對沖數據稀缺瓶頸,換取單位算力更高的智能產出。
這種技術取向的轉變,也呼應了 AI 落地的深層變化:當技術走出實驗室,競爭早已不是某一項能力的單點突破,而是準確性、泛化性、數據、算力之間的系統統籌——每一個環節都可能成為瓶頸,也都可能成為突破口。
下面這四篇論文,恰好從這四個方向,展現了華為的系統化工程能力和技術選擇。

01
視覺基礎模型的規模化競賽中,一直存在一層隱形的"天花板"。
普通ViT的規模化一路高歌猛進,從6B到22B不斷刷新上限。但層次化ViT始終卡在2B參數以下。
不是不想做大,是做不大。層級化模型對數據和訓練策略的要求比普通ViT高得多,簡單套用普通ViT的規模化方案行不通。
這就導致了一個結構性矛盾——層級化ViT天然擅長多尺度表征和密集預測任務(目標檢測、分割、視頻理解),但規模上不去,能力的上限就被鎖死了。
華為團隊的這篇《Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters》,把規模上限從 2B 直接推到了 30B。

怎么做到的?答案是對模型結構和訓練策略都進行重新設計,兩者缺一不可。
結構上的核心設計是 Efficient Hierarchical ViT 架構。它在保證多尺度特征提取能力的同時,兼顧了計算效率。
基于這一架構,團隊訓練了從 200M 到5B參數的稠密模型,并引入稀疏專家混合(SMoE)變體,將總參數量推到了30B——這是目前層次化ViT領域已公開的最大參數規模。
訓練上,團隊設計了一套兩階段流程:
第一階段,在ImageNet-21K上做MAE自監督預訓練,讓模型學會視覺表征的基本規律;
第二階段,在2700萬圖像數據集上,從多個最先進的通用基礎模型中蒸餾知識,實現能力躍遷。
實驗結果給出了最有力的證明。在ImageNet-1K線性評測中,總參數30B的MoE模型(EHV-5B-MoE)推理時僅激活67億參數,就以89.0%的準確率,超越了普通ViT路線下、總參數更大的模型EVA-CLIP-18B。
更重要的是,它的性能提升不局限于圖像分類——視頻分析和密集預測任務上同樣表現優異。這說明EHV學到的不只是分類特征,而是真正高質量、可泛化的視覺表征。
華為團隊用這項工作,證明了層次化ViT不僅能做大,而且在推理側,能用更少的激活參數,達到更高的準確性。
架構設計決定了模型的能力上限,而訓練策略則決定了這一上限能在多大程度上被釋放。

02
模型底座的天花板抬高了,但算力的消耗不僅僅在模型本身,喂給模型的數據,同樣在大量吞噬計算資源。
視頻-大語言模型(Video-LLMs)處理視頻時,計算成本主要消耗在幀編碼上。為了控制成本,現有模型幾乎都采用均勻采樣——等間隔抽幀。
然而,視頻里的關鍵事件從來不會均勻分布。一個重要的動作可能只持續一兩秒,如果恰好落在兩個采樣點之間,就被徹底漏掉了。相反,那些冗長的靜態畫面卻被反復編碼,浪費了寶貴的計算資源。
另一種思路是查詢驅動的方法——根據具體問題去檢索相關的幀。這在視頻問答場景下確實有效,但詳細視頻描述是一個“無查詢”任務,這種方法在這里派不上用場。
均勻采樣太粗糙,查詢驅動的方法又用不了。怎么破?
華為 AI 數據團隊提出的可學習的幀選擇器 LFS(Learnable Frame Selector),試圖來解決這個問題。

論文地址:https://arxiv.org/pdf/2601.14594v1
他們的核心想法很直接:與其靠人工規則選幀,不如讓模型自己學會“該看什么” 。

這是一種“以終為始”的訓練范式,LFS 不再學“選哪些幀在某個中間得分上更高”,它學的是“選哪些幀能讓大模型寫出更好的描述”。
具體怎么做的?三個關鍵設計:
第一,訓練一個評分網絡,給每一幀打一個“事件重要性”分數。

第二,分段選幀而非全局排序。選幀時不用簡單的“得分最高的前K個”,而是把整個視頻切成多個時間段,在每個時間段里分別挑最重要的幀。這樣既抓住了關鍵事件,又保證了幀在時間軸上分布均勻。
第三,也是最關鍵的一步——訓練方式。LFS選好幀之后,把它們喂給凍結的Video-LLM生成描述,拿生成的描述和人工標注的標準描述做對比,算出損失,再反向傳播去更新幀選擇器的參數。整個過程中大語言模型本身一動沒動,LFS就像一個即插即用的外掛模塊。
此外,研究團隊還發現了一個問題:現有的詳細視頻描述基準和人類真正的認知之間有挺大的差距。因此他們自建了一個新基準ICH-CC,視頻全部來源于中國非遺烹飪的真實商業場景(如餐廳后廚、烹飪教學等),所有描述和問答均由人工精心撰寫,更貼近真實應用場景。

實驗結果怎么樣?

LFS在不同模型和不同基準上都帶來了普遍且穩定的提升。所有模型的 LFS增強版,在所有測試基準上都高于基線模型,這說明LFS 不僅能在單一基準上取得好成績,具備一定的通用性。
這也回應了論文的核心命題:與其讓模型在均勻采樣的幀上“硬算”,不如在輸入端做一次智能篩選——選對了幀,下游任務的表現也隨之有所提升。


03
大語言模型的跨任務泛化能力,一直是個“說起來重要、做起來難”的問題。
現有主流方案是per-token動態路由——每個token在處理時,都要在多個LoRA適配器之間做選擇,決定走哪條路。這套機制確實有效,但代價也不小:計算量和顯存占用都居高不下,模型跑起來又慢又吃顯存。
另一種思路——表征微調(ReFT),則不再動模型參數,而是只編輯前綴和后綴token的表征來實現單任務適配,效率比LoRA高不少。
但它有兩個短板:一是token本身的語義就有歧義,只改首尾不夠精準;二是缺少一種“自引導”機制,模型面對沒見過的新任務時,不知道該改哪一層、改哪個表征。
華為云團隊與多所高校合作,提出了表征感知的模塊化 RaMod(Representation-Aware Modularity) 框架,把 ReFT 的思路成功擴展到了跨任務泛化場景。

核心做法可以拆成兩部分來看:
第一部分是雙模塊表征與參數微調。ReFT只能動首尾,RaMod 精細得多——從中間層的隱藏表征里挑出一個策略篩選過的子集,來做模塊化干預。改哪里、怎么改,都是有選擇、有策略的。這樣能更精準地引導模型去解決沒見過的任務。
第二部分是異步調度器。跨任務泛化最怕顯存不夠,RaMod設計了一套主動調度機制:需要哪些干預就分配顯存,用完了就主動釋放。這樣一來,存儲開銷被壓到了最低。
效果立竿見影。實驗表明,RaMod不僅跨任務泛化效果更好,成本也大幅下降:相較于原始 LLMs,該方法額外預填時間減少了83%,生成延遲降低 100%,顯存占用少了79%。
換句話說,RaMod把任務適配從"改模型"變成了"調表征"——不動模型主體,只在關鍵層的隱藏狀態上做定點編輯。
這種思路如果成立,大模型部署的經濟學可能會被改寫:一個底座模型配上若干輕量級干預模塊,就能低成本地服務于截然不同的任務場景,而不必為每個場景單獨訓練或加載完整副本。
不過在“改寫”之前,這種表征微調的方法,仍有一些關鍵問題需要回答,比如在復雜推理等高難度場景中,是否依然能在大幅節省算力成本的同時守住準確性。

04
前三篇論文都在解決"怎么更高效地用模型"。但很多任務還有一個更根本的現實挑戰:如果連訓練數據都不夠呢?
語碼轉換(Code-Switching,CS)語音翻譯任務,需要將夾雜多種語言的語音翻譯成目標語言。這種任務不僅語義建模復雜,CS 數據的稀缺性,更是一個大問題。
以前的研究主要靠兩條路走:要么讓模型自己去"悟"語義表征,效果不可控;要么花大價錢做人工標注,成本太高,規模也做不大。
華為翻譯服務中心團隊,與廈門大學、澳門大學合作的這篇論文,提出了一個新思路:與其讓模型自己摸索不同語言的語義表征,不如主動把它們對齊好——為每種語言單獨建一個"專家團隊",讓各團隊分別負責各自語言的語義建模,最后再統一對齊。

論文地址:https://arxiv.org/pdf/2511.10670
具體實現方式有兩個關鍵設計:
第一個是MoE(混合專家)語音投影器。傳統投影器對所有語言一視同仁,效果自然不理想。MoE版本的做法是給每種語言分配一組專門的"專家",每個專家組只負責一種語言的細粒度語音特征建模。路由機制會自動把語音特征送到對應語言的專家組手里。

為了保證路由不跑偏,論文還引入了兩個輔助損失:語言特定損失確保每個專家真正學會對應語言的特征,組內負載均衡損失防止所有token都擠到同一個專家。
第二個是多階段訓練范式。數據不夠,就用策略來湊。整個訓練分四步走:先用自動語音識別(ASR)數據分別預訓練每種語言的投影器,打好語音-文本對齊的基礎;然后把各語言的投影器組裝成MoE結構,用語言特定損失和負載均衡損失聯合優化;接著從ASR 數據逐步過渡到單語語音翻譯(ST)數據,用過渡損失平滑遷移;最后從 ST 數據適配到CS語音翻譯數據。
這套漸進式設計的精妙之處在于——不是讓模型直接硬啃稀缺的 CS 數據,而是先用充足的 ASR 和 ST 數據把基礎能力打牢,再一步步轉向目標任務。

實驗對比了Whisper、SeamlessM4T、LLaST等多個強基線模型。在Fisher和NTUML2021的四個測試集上,該方法均超越了其他模型中表現最突出的 SeamlessM4T,BLEU最高達到39.52,COMET最高達到81.33。
這項工作傳遞的信號很明確:在數據稀缺的跨語言場景下,精細化的架構設計和漸進式的訓練策略,也許比單純堆數據更管用。
需要注意的是,這項工作在語言數量有限、數據質量可控的場景下,是有效的“尖刀方案”,但在需要覆蓋數十種語言的通用多語種翻譯系統中,是否具備可擴展性,還需要進一步論證。

05
30B層次化ViT重構了模型骨架,讓67億激活參數在ImageNet上超越了180億的對手;
LFS在輸入端做了一道減法,把大量無意義的幀編碼開銷擋在計算之前;
RaMod把全量微調壓縮成表征層的定點編輯,跨任務適配的顯存和延遲一起降了下來;
語碼轉換語音翻譯則用MoE分工和漸進式訓練,在數據最匱乏的賽道上證明了一個道理:架構的智慧,有時候能夠彌補數據的貧瘠。
四篇論文,四個方向,都在指向同一個內核:華為正在用“設計密度”取代“規模密度”。四篇論文分別來自基礎研究、AI數據、云服務和翻譯服務中心,說明效率優先已不僅僅是某個團隊的偏好,這個邏輯被寫進了各個環節的技術選擇里。
如果把過去兩年的AI競賽比作“拼礦”,那2026年正顯露出一個拐點:拼“冶煉技術”的時代已經開始了。稀疏激活、智能篩選、模塊化適配、漸進式訓練——這些路徑不依賴更多的芯片和算力,而依賴對問題本身更深刻的理解。
無論大廠還是創業公司,早已走過了參數軍備賽,AI 的下半場,對現實落地問題的理解,以及系統化解決這些問題的工程能力,才是真正的決勝點。雷峰網(公眾號:雷峰網)雷峰網雷峰網
IJCAI 2026 要來了,你還在單打獨斗?
為了方便大家抱團交流、互通會議消息,我們專門建了 IJCAI 2026 參會群!進群你會解鎖這些「福利」?
會議情報站:投稿 DDL、格式規范、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。
同行茶話會:天南海北的同行都在群里,聊心得、碰思路、攢人脈,科研路上我們同行。
前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。
現場后援團:(會議期間專屬開啟):到了會場也不用慌——
路線導航:場館分布、報告廳怎么走,群里隨時問;
議題共讀:熱門 session、Keynote 現場探討,錯過也能追;
Poster 匯編:現場海報精華整理,一鍵收藏不遺漏;
約局廣場:約飯局、采訪局、交流局……想嘮嗑、想合作、想面基,群里發起就成。
? 進群傳送門: 掃碼進群或添加微信Qvv0909777,備注:IJCAI + 單位/學校+姓名+方向。

搞科研/搞技術,信息差很重要。
來,一起快人一步!


上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。