0
| 本文作者: 張璐 | 2026-07-08 18:11 | 專題:ICML:國際機(jī)器學(xué)習(xí)會議 |
7月8日,機(jī)器學(xué)習(xí)領(lǐng)域最具影響力的頂級學(xué)術(shù)會議ICML 2026進(jìn)入正會第二天。本次大會共接收6352篇論文,其中Spotlight論文536篇(占投稿總數(shù)的 2.2%),Oral 論文168篇 (僅占投稿總數(shù)的 0.7 %)。
今年的論文再次匯聚了從生成模型到隱私保護(hù)、從智能體評估到模型壓縮、從脈沖神經(jīng)網(wǎng)絡(luò)到視覺分詞器的多元前沿探索,在投稿量較去年翻倍、評審標(biāo)準(zhǔn)經(jīng)歷深刻“重新校準(zhǔn)”的背景下,這些脫穎而出的論文無疑是本屆會議最值得關(guān)注的學(xué)術(shù)精華。
雷峰網(wǎng)(公眾號:雷峰網(wǎng))已派出報(bào)道小組赴首爾COEX會展中心參會。在會議現(xiàn)場,我們從Poster展區(qū)的數(shù)千張學(xué)術(shù)海報(bào)中精選出最具代表性的研究成果,以“一張圖 + 一段解讀”的方式呈現(xiàn)給未能親臨現(xiàn)場的讀者。
這份匯總不僅是一次視覺巡禮,更試圖為你勾勒出本屆ICML的學(xué)術(shù)重心——從大模型可解釋性到AI for Science,從具身智能到理論硬度的回歸,我們希望這些現(xiàn)場捕捉的瞬間,能幫助你快速感知機(jī)器學(xué)習(xí)前沿正在發(fā)生什么。
以下精選Poster Session 3九篇Spotlight論文,一文看盡AI研究最值得關(guān)注的方向。(如果你也想讓你的研究成果出現(xiàn)在這里,請與我們聯(lián)系):
Fast Spectrally Sparse Signal Reconstruction via Jacobi-Preconditioned Gradient Descent
光譜稀疏信號重建在多種實(shí)際應(yīng)用中具有重要意義,在數(shù)學(xué)上其通常可轉(zhuǎn)化為低秩 Hankel 矩陣補(bǔ)全問題。盡管現(xiàn)有一階算法能夠保持較低的計(jì)算復(fù)雜度,但其收斂速度極度取決于條件數(shù),存在顯著的效率瓶頸。此外,低秩 Hankel 矩陣的固有特性使得直接基于流形的方法復(fù)雜度過高,且復(fù)雜對稱分解所引入的模糊性(ambiguity)也極難處理。
針對這一理論與計(jì)算雙重挑戰(zhàn),本研究創(chuàng)新性地提出了雅可比預(yù)條件梯度下降(Jacobi-Preconditioned Gradient Descent)方法。該方法巧妙結(jié)合生成器,將基于因子的迭代映射到矩陣空間中,從而在理論上實(shí)現(xiàn)了等價(jià)于流形方法的直接收斂分析。大量實(shí)驗(yàn)表明,該算法在迭代次數(shù)和實(shí)際計(jì)算時(shí)間兩個核心指標(biāo)上,均顯著優(yōu)于現(xiàn)有最先進(jìn)的方法,且能完美適配多種復(fù)雜的問題場景。該工作通過成功引入雅可比預(yù)條件技術(shù),徹底突破了傳統(tǒng)一階算法收斂速度受條件數(shù)限制的百年難題,在理論與實(shí)驗(yàn)上雙向驗(yàn)證了其卓越的高效性。

論文鏈接:https://openreview.net/forum?id=b4HR1jhoRV
Incentivizing Truthfulness and Collaborative Fairness in Bayesian Learning

論文鏈接:https://openreview.net/forum?id=YgzbofmRr6
Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking
大語言模型的越獄(Jailbreak)技術(shù)發(fā)展速度日新月異,相比之下,安全基準(zhǔn)測試的更新卻顯得嚴(yán)重滯后。現(xiàn)有的基準(zhǔn)測試由于數(shù)據(jù)集、評測工具及評估協(xié)議的不斷漂移,導(dǎo)致模型魯棒性的估計(jì)不僅常常滯后,而且極難被獨(dú)立復(fù)現(xiàn),無法實(shí)現(xiàn)跨研究的統(tǒng)一對比。
為了攻克這一安全評測難題,本研究設(shè)計(jì)了一套系統(tǒng)化流程,將前沿的越獄研究轉(zhuǎn)化為可執(zhí)行的標(biāo)準(zhǔn)化模塊,推出了 JAILBREAK FOUNDRY 系統(tǒng)。該系統(tǒng)三大核心組件相輔相成:包括共享工具庫 JBF-LIB、模塊轉(zhuǎn)換工具 JBF-FORGE 以及標(biāo)準(zhǔn)化評估工具 JBF-EVAL,能夠提供即時(shí)評估并有效減少評估標(biāo)準(zhǔn)漂移帶來的負(fù)面影響。團(tuán)隊(duì)在 30 個主流攻擊方法和 10 個受測大模型上展開了廣泛實(shí)驗(yàn),不僅成功復(fù)現(xiàn)了與原始文獻(xiàn)高度一致的攻擊結(jié)果,還大幅減少了近一半的代碼實(shí)現(xiàn)成本。該工作通過模塊化與標(biāo)準(zhǔn)化實(shí)現(xiàn)了攻擊集成與評估自動化的閉環(huán),成功建立起一套可持續(xù)更新的動態(tài)安全基準(zhǔn),為快速變化的 AI 安全領(lǐng)域提供了強(qiáng)有力的底層防御與評測支持。

論文鏈接:https://openreview.net/forum?id=BSi2mfMDsx
When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models
隨著大規(guī)模圖像編輯模型從傳統(tǒng)的“文本驅(qū)動”轉(zhuǎn)向新型的“視覺提示驅(qū)動”,用戶開始頻繁通過標(biāo)記、箭頭等視覺輸入來直觀表達(dá)編輯意圖。然而,這種交互范式的轉(zhuǎn)變帶來了顯著的安全性風(fēng)險(xiǎn),使得視覺輸入淪為了潛在的全新攻擊面。
為了揭示并防御這一新興威脅,本研究首次提出了基于視覺到視覺的越獄攻擊(Vision-to-Vision Jailbreak Attack, VJA),深入探索了視覺輸入如何被惡意利用來隱蔽傳遞違規(guī)指令。實(shí)驗(yàn)結(jié)果令人警惕:通過精心構(gòu)造的視覺信息,VJA 攻擊對 Nano Banana Pro 和 GPT-Image-1.5 等主流商用模型的攻擊成功率分別高達(dá) 80.9% 和 70.1%,徹底暴露了當(dāng)前圖像編輯模型在視覺提示處理中的嚴(yán)重漏洞風(fēng)險(xiǎn)。
針對該痛點(diǎn),論文不僅設(shè)計(jì)了 IESBench 基準(zhǔn)作為安全評估工具,還提出了一種基于多模態(tài)推理的無訓(xùn)練防御機(jī)制。該機(jī)制通過直觀分析,能夠以極小的計(jì)算資源需求,有效緩解模型對惡意視覺提示的敏感性。本工作深刻揭示了視覺提示驅(qū)動架構(gòu)的安全隱患,通過構(gòu)建 IESBench 基準(zhǔn)和創(chuàng)新的無訓(xùn)練防御方法,為打造安全、可信的大型圖像編輯系統(tǒng)奠定了堅(jiān)實(shí)的防御基礎(chǔ)。

論文鏈接:https://openreview.net/forum?id=wQxRphkfxn
LaST0: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
視覺-語言-動作(VLA)模型在通用操作方面表現(xiàn)出色,但其傳統(tǒng)的顯式推理過程往往會導(dǎo)致較高的推斷延遲,且難以有效表達(dá)復(fù)雜的物理屬性,對高時(shí)間分辨率的機(jī)器人快速操作構(gòu)成了嚴(yán)重限制。顯式推理受限于語言表達(dá)的天然瓶頸,無法準(zhǔn)確描述某些無法言傳的物理特性,從而極大地影響了任務(wù)完成效果。
為了攻克這一瓶頸,本研究創(chuàng)新性地提出了 LaST0 —— 一種高效的隱潛時(shí)空鏈?zhǔn)酵评恚–hain-of-Thought)框架。該方法巧妙構(gòu)建了由“低頻推理專家”與“高頻動作生成專家”組成的雙系統(tǒng)架構(gòu),并通過異頻訓(xùn)練機(jī)制,完美實(shí)現(xiàn)了跨時(shí)間的一致性推理與高效的動態(tài)動作生成,在解決推理延遲的同時(shí),大幅提升了模型對物理和機(jī)器人動力學(xué)屬性的捕捉能力。
團(tuán)隊(duì)在 10 項(xiàng)真實(shí)場景任務(wù)中展開了嚴(yán)格測試,任務(wù)全面涵蓋桌面操作、移動平臺及靈巧手操縱。實(shí)驗(yàn)結(jié)果表明,LaST0 較現(xiàn)有最先進(jìn)的 SOTA 方法,在三類任務(wù)的成功率上分別顯著提升了 13%、14% 和 14%。該工作成功開發(fā)出一種能夠自適應(yīng)切換推理與執(zhí)行的高效雙系統(tǒng)架構(gòu),為具身智能(Embodied AI)模型的任務(wù)成功率與時(shí)間效率雙向躍升提供了全新范式。

論文鏈接:https://openreview.net/forum?id=lwOoBzJykL
Alignment-Guided Score Matching for Text-to-Image Alignment in Diffusion Models
目前的擴(kuò)散模型雖然能夠生成高質(zhì)量的圖像,但在“文本-圖像對齊(Text-to-Image Alignment)”上仍顯不足。現(xiàn)有的主流優(yōu)化方法大多依賴于外部的獎勵(Reward)模型或人類偏好信號,導(dǎo)致直接解決擴(kuò)散生成過程中的錯配問題依舊充滿挑戰(zhàn)。此外,傳統(tǒng)對比學(xué)習(xí)方法在優(yōu)化軟文本令牌時(shí),往往會因?yàn)檫^度懲罰負(fù)樣本而導(dǎo)致特定性失敗(如過度計(jì)數(shù)和物體異常重復(fù)),甚至引發(fā)語義失真和細(xì)節(jié)丟失。
為了打破這一僵局,本研究提出了一種無需獎勵模型的輕量級后訓(xùn)練(Post-training)方法。該方法創(chuàng)新性地將“對比對齊引導(dǎo)(Contrastive Alignment Guidance)”直接整合到擴(kuò)散模型的底層分?jǐn)?shù)匹配(Score Matching)目標(biāo)中,通過在分?jǐn)?shù)層面進(jìn)行直接的方向賦予,從根本上改善了對齊效果并減少了生成失敗的概率。
研究團(tuán)隊(duì)利用業(yè)界公認(rèn)的 GenEval 基準(zhǔn)測試對該方法進(jìn)行了嚴(yán)格評估,結(jié)果顯示,該方法在計(jì)數(shù)準(zhǔn)確率上實(shí)現(xiàn)了超過 35% 的突破性提升,并全面驗(yàn)證了其在 SD1.5、SDXL 及 SD3 等多代主流擴(kuò)散模型中的極強(qiáng)兼容性。該工作成功開辟了一條提升文本-圖像對齊的創(chuàng)新后訓(xùn)練路徑,不僅能與現(xiàn)有的強(qiáng)化學(xué)習(xí)(RL)后訓(xùn)練方法形成完美互補(bǔ),更極大擴(kuò)展了擴(kuò)散模型在復(fù)雜文本聯(lián)動生成中的應(yīng)用潛力。

論文鏈接:http://openreview.net/forum?id=vKWxArobP3
Weak Diffusion Priors Can Still Achieve Strong Inverse-Problem Performance
擴(kuò)散模型(Diffusion Models)近年來被廣泛應(yīng)用于求解各類圖像和信號的逆問題(Inverse Problems)。然而,這類方法往往建立在一個高度理想化的假設(shè)之上——即擴(kuò)散模型必須具備極高的保真度且與目標(biāo)數(shù)據(jù)完美匹配。但在實(shí)際復(fù)雜的工程應(yīng)用中,獲取如此完美的強(qiáng)先驗(yàn)往往代價(jià)高昂,因此探索“弱擴(kuò)散先驗(yàn)(Weak Diffusion Priors)”在逆問題中的有效性具有重大的現(xiàn)實(shí)意義。
為了厘清弱先驗(yàn)的性能邊界,本研究系統(tǒng)探討了它在具體條件下的表現(xiàn),并深入分析了其何時(shí)能夠與強(qiáng)先驗(yàn)方法相媲美。實(shí)驗(yàn)現(xiàn)象表明,弱先驗(yàn)的性能存在明顯的兩極分化:在觀測信息充足(如觀測像素較多)的高信息量情況下表現(xiàn)極其良好;但在低信息量或嚴(yán)重缺失的場景下則表現(xiàn)欠佳。
針對這一現(xiàn)象,論文基于貝葉斯一致性理論(Bayesian Consistency Theory)展開了嚴(yán)密的數(shù)學(xué)推導(dǎo),深入剖析了高維測量如何引導(dǎo)后驗(yàn)概率成功集中于真實(shí)信號附近。團(tuán)隊(duì)進(jìn)行了廣泛而全面的實(shí)驗(yàn),場景設(shè)計(jì)巧妙涵蓋了不同的信息量梯度以及失配先驗(yàn)差異,從而清晰勾勒出了弱擴(kuò)散先驗(yàn)的適用范圍和底層局限性。該工作有力證明了弱擴(kuò)散先驗(yàn)在特定條件下的可靠性,深刻揭示了高維觀測對信號恢復(fù)的決定性作用,為逆問題領(lǐng)域的未來研究提供了堅(jiān)實(shí)的底層理論支持與代碼實(shí)現(xiàn)。

論文鏈接:https://openreview.net/forum?id=fdkSA4F0lN
Incremental BPE Tokenization
字節(jié)對編碼(Byte Pair Encoding, BPE)是現(xiàn)代大語言模型(LLM)中最核心的分詞技術(shù)。然而,現(xiàn)有的 BPE 分詞算法在流式輸入(Stream Input)或長文本、復(fù)雜文本輸入下存在嚴(yán)重的效率瓶頸。現(xiàn)象分析指出,即便像 Hugging Face 和 OpenAI tiktoken 這樣工業(yè)界廣泛采用的成熟分詞器實(shí)現(xiàn),在某些極端輸入場景下也會表現(xiàn)出顯著的延遲,無法完美滿足流處理和低延遲場景下的實(shí)際性能需求。
為了打破這一傳統(tǒng)限制,本研究創(chuàng)新性地提出了一種增量式 BPE 算法(Incremental BPE)。該方法強(qiáng)力支持對不斷追加的輸入前綴進(jìn)行即時(shí)分詞(Real-time Tokenization),成功實(shí)現(xiàn)了流式輸出。在算法復(fù)雜度方面,它將總體復(fù)雜度保證在O(n \log^2 t)的優(yōu)異水平,徹底規(guī)避了傳統(tǒng)方法對長文本重復(fù)計(jì)算的缺陷。
研究團(tuán)隊(duì)在包含 Hugging Face 和 OpenAI tiktoken 的多個權(quán)威基準(zhǔn)上對該算法展開了深度評估。實(shí)驗(yàn)結(jié)果表明,該增量式分詞器在處理復(fù)雜輸入時(shí),在速度上實(shí)現(xiàn)了最多 3 倍的突破性提升,并顯著降低了流式交互中的響應(yīng)延遲。該工作不僅在理論上證明了 BPE 分詞完全可支持增量式實(shí)現(xiàn),更設(shè)計(jì)出了極其高效的落地算法,為現(xiàn)代大語言模型高吞吐、低延遲的流水線優(yōu)化提供了關(guān)鍵的技術(shù)演進(jìn)。

論文鏈接:https://openreview.net/forum?id=ZbWgrDzCQo
Position: Digital Agents Require Unified Agent-Native Environments
當(dāng)前大語言模型(LLMs)作為數(shù)字代理(Digital Agents)已被廣泛應(yīng)用于執(zhí)行各類多步數(shù)字工作。然而,目前它們所依賴的操作環(huán)境極度分散且任務(wù)特定化,極大地限制了模型的通用性與多任務(wù)協(xié)作性。現(xiàn)象分析指出,現(xiàn)有環(huán)境嚴(yán)重缺乏兼容性和模塊化設(shè)計(jì),導(dǎo)致代理在處理復(fù)雜長程任務(wù)時(shí),往往難以在文本流與圖形用戶界面(GUI)交互之間進(jìn)行有效的融合與協(xié)調(diào)。
針對這一環(huán)境碎片化的核心痛點(diǎn),本文作為一篇極具行業(yè)前瞻性的觀點(diǎn)文章(Position Paper),主張為大模型打造統(tǒng)一的“代理原生(Agent-Native)”計(jì)算機(jī)環(huán)境。
為了將這一理念落地,研究團(tuán)隊(duì)開發(fā)了 AgentVM 平臺。該平臺創(chuàng)新性地整合了現(xiàn)代操作系統(tǒng)中的 GUI 交互和文本交互,并基于共享系統(tǒng)狀態(tài),實(shí)現(xiàn)了分模塊化的環(huán)境視圖設(shè)計(jì)。旨在通過與大模型能力完美對齊的觀察和操作空間,從底層解決環(huán)境孤立問題。
通過嚴(yán)謹(jǐn)?shù)亩亢投ㄐ詫?shí)驗(yàn)驗(yàn)證,該統(tǒng)一的代理原生計(jì)算機(jī)環(huán)境在支持多任務(wù)數(shù)字代理方面展現(xiàn)出了巨大的顯著優(yōu)勢。該工作不僅首次系統(tǒng)性地提出了“數(shù)字代理原生環(huán)境”這一革命性概念,更通過開發(fā) AgentVM 平臺證明了環(huán)境統(tǒng)一化設(shè)計(jì)的可行性,為構(gòu)建真正通用、高自適應(yīng)性的新一代數(shù)字代理奠定了關(guān)鍵的生態(tài)基石。

論文鏈接:https://openreview.net/forum?id=XZaRHkbc2u
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。
本專題其他文章