0
| 本文作者: 陳淑瑜 | 2026-07-09 18:34 | 專題:ICML:國際機器學習會議 |
作為國際頂級的機器學習會議,今年的ICML吸引了數千篇論文投稿,其中Spotlight論文更是百里挑一,代表著當前AI研究的最前沿方向。
雷峰網(公眾號:雷峰網)已派出報道小組赴首爾COEX會展中心參會。在會議現場,我們從Poster展區的數千張學術海報中精選出最具代表性的研究成果,以“一張圖+一段解讀”的方式呈現給未能親臨現場的讀者。
雷峰網 & AI科技評論在現場為您帶來第一手報道,精選六篇Spotlight論文,涵蓋空間智能、腦網絡分析、圖學習、推理優化、LLM記憶與高效生成等多個領域,一窺AI最前沿的突破與趨勢。
如果你也想讓你的研究成果出現在這里,請與我們聯系:
視覺語言模型(VLM)在常識推理任務上表現出色,但在視覺空間推理方面存在明顯短板。現有解決方案大多引入額外的3D先驗知識或外部空間編碼器,不僅增加了模型復雜度,還在空間微調后損害了VLM原有的通用能力。如何在增強空間智能的同時不“撿了芝麻丟了西瓜”,成為該領域亟待解決的核心矛盾。
SpatioLM提出了一種參數高效的解決方案,設計了一個即插即用、非侵入式的空間視覺模塊,激發VLM中固有但未被充分利用的空間知識,而非引入外部編碼器。此外,該方法創新性地利用偽深度和相機信息作為監督信號,引導模型學習物理上連貫的空間表示,使模型能夠真正"理解"三維物理世界。
實驗結果令人矚目:SpatioLM在VSI-Bench上取得71.6分,成為首個突破70分大關的模型,同時在空間感知和理解任務上全面領先。更重要的是,模型的通用能力未受損害,在遷移到具身操作任務時也展現出競爭力。這一工作為VLM空間智能提供了優雅且實用的新范式。

論文鏈接:https://openreview.net/forum?id=9NqKL9QQ4a
多模態腦網絡分析旨在從功能連接組預測神經精神狀態,但現有方法大多將表型信息視為輔助特征進行后期融合,隱含假設無論表型如何,連接組的表示方式都相同。然而在臨床神經科學中,相同的功能連接模式在不同表型語境下可能支持截然不同的結論,這一關鍵事實被傳統方法所忽視。
PhenoBrain提出了一種新穎的框架,在機制層面而非分類器層面注入表型信息。具體而言,該方法設計了表型條件化的長程路由機制,學習主體特定的多跳通信核來建模長程連接組交互;同時提出表型引導的注意力機制調節方法,將表型信息作為條件先驗來調節腦網絡中注意力的學習過程。這種“機制層注入”的策略使表型信息能夠全程參與表示學習。
為驗證方法有效性,研究團隊基于開源圖像數據構建了兩個多模態腦網絡分析數據集。大量實驗證明PhenoBrain達到了最先進的性能,為腦網絡分析與臨床神經科學的結合提供了新工具。

論文鏈接:https://arxiv.org/abs/2605.23467
消息傳遞神經網絡(MPNN)在捕捉長距離依賴時常遭遇"過度壓縮"(Oversquashing)問題:信息在多層傳播中被過度壓縮而丟失。現有譜濾波方法雖能通過全局信息混合緩解此問題,但其理論保障依賴于強假設(Jacobian敏感度下界),而這些假設在實踐中往往難以滿足。
S3GNN重新審視了這些理論結論,發現相關Jacobian敏感度下界在實際中通常難以實現,隨后提出了一種無需限制性假設即可緩解過度壓縮的新方法。該方法通過輕量級地重新引入被省略的組件,將高效全局混合與局部消息傳遞相結合,在新動力學框架下保持標準特征變換的穩定性約束有效,同時大幅降低了計算復雜度。
在長距離基準、知識圖譜問答和網格流體動力學等多個領域的實驗中,S3GNN實現了高達一個數量級的誤差降低,且參數量減少高達50%。這一工作不僅糾正了現有理論的認識偏差,更以更少的參數實現了更好的性能,為圖學習領域樹立了新標桿。

論文鏈接:https://arxiv.org/abs/2602.08498
大型推理模型日益依賴具有復雜內部結構的推理軌跡,但現有研究對三個基本問題缺乏統一回答:什么定義了高質量推理?如何可靠評估長且隱式結構化的推理軌跡?如何將評估信號用于推理優化?這些問題之間的鴻溝,制約了推理模型的系統性改進。
該研究提出了ME2原則,從宏觀和微觀兩個層面,沿效率和有效性兩個維度來刻畫推理質量。在此基礎上,將推理軌跡建模為有向無環圖(DAG)以捕捉復雜推理結構,開發基于DAG的成對評估方法,并構建TRM-Preference數據集訓練思考獎勵模型(TRM),使推理質量評估可規模化,打通了從評估到優化的閉環。
實驗驗證了思考獎勵作為優化信號的有效性:在測試時選擇更好的推理軌跡可帶來最高19.3%的性能提升,在強化學習訓練中增強推理能力可獲得最高3.9%的性能提升。這一工作為推理質量的定義、評估和優化提供了首個統一框架,具有重要的理論價值和實踐意義。

論文鏈接:https://arxiv.org/abs/2510.17281
擴展數據規模、參數量和測試時計算一直是改進LLM系統的主要路徑,但隨著高質量數據逐漸枯竭、計算資源邊際收益遞減,這條路徑已接近上限。受人類從實踐中學習的能力啟發,為LLM構建記憶和持續學習框架成為重要研究方向。然而,現有基準測試大多聚焦于同質化的閱讀理解任務,而非測試系統在服務期間從累積用戶反饋中學習的能力。
MemoryBench提出了一個用戶反饋模擬框架和涵蓋多領域、多語言、多任務類型的綜合基準測試,專門評估LLM系統的持續學習能力。該基準模擬真實服務場景中用戶與LLM的交互過程,測試系統能否從用戶反饋中學習并持續優化自身表現,填補了現有評估體系的空白。
實驗揭示了一個令人警醒的事實:當前最先進的方法在有效性和效率方面均遠未達到令人滿意的水平。這一發現表明,LLM的記憶與學習能力仍是一個巨大的未解難題,MemoryBench為未來研究提供了重要的評估基礎設施和方向指引。

論文鏈接:https://arxiv.org/abs/2606.15070
大型推理模型通過鏈式思考(CoT)解決復雜問題,但常常陷入“過度思考”。生成冗余的推理token,不僅浪費計算資源,還導致準確率下降。現有緩解方法要么需要大量訓練資源,要么依賴精心設計的提示詞或不可靠的置信度信號,缺乏一種高效、可靠且易于部署的早停機制。
ASAG(Attention-State Adaptive Generation)從注意力分布的獨特視角切入,通過分析推理過程中注意力狀態的變化來推斷模型的推理狀態,進而自適應地調整生成策略。該方法無需訓練、即插即用,可無縫集成到現有的推理模型中,在模型"想清楚了"的時候及時停止生成,避免無效推理。
在9個基準測試上的實驗表明,ASAG在DeepSeek-R1-Distill和Qwen3系列等主流模型上均取得一致提升。特別是在Qwen3-8B上,平均準確率提升3.2%,生成token數減少近40%。這一工作證明:學會"停下來",反而能讓AI更聰明。

從空間智能到腦網絡分析,從圖學習到推理優化,從LLM記憶到高效生成,
這六篇Spotlight論文展現了ICML 2026的多元創新面貌。它們或突破評測天花板,或填補理論空白,或揭示能力短板,共同指向一個趨勢:AI研究正在從"更大更強"走向“更智能、更高效、更可持續”。
雷峰網&AI科技評論將繼續在現場帶來更多ICML 2026的精彩內容,如果你想推薦ICML上的其他論文,歡迎聯系我們進一步交流探討 。
上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。