0
| 本文作者: 陸毅 | 2026-07-10 17:19 | 專題:ICML:國際機器學習會議 |
大模型不會"反過來想"?ICML 2026 這9篇論文正在改寫規則
2026年7月6日,第43屆國際機器學習大會(ICML 2026)在韓國首爾COEX會展中心正式拉開帷幕。作為機器學習領域全球最具影響力的學術盛會之一,本屆會議共收到23918篇有效投稿,最終接收6352篇論文,536篇入選Spotlight。雷峰網與AI科技評論記者在現場為大家帶來一線報道,從536篇Spotlight論文中精選9篇代表作,涵蓋大模型推理、數據與評測、城市計算、不確定性量化、視頻生成與多智能體強化學習等方向,帶你一文速覽機器學習最前沿的研究風向。
Breaking the Reversal Curse in Autoregressive Language Models via Identity Bridge
自回歸大語言模型能在復雜任務中表現出色,卻在簡單邏輯推理上屢屢翻車:學了"Alice的丈夫是Bob",卻答不出"Bob的妻子是Alice"。這就是"反轉詛咒",此前長期被認為是自回歸因果模型的固有缺陷。
加州大學伯克利分校的研究團隊提出了名為"Identity Bridge"(身份橋)的數據配方。他們在正向關系數據外加入"Alice的名字是Alice"這類身份映射,并重寫為OCR形式,讓模型在優化中自動編碼反向關系。理論證明,即使是單層Transformer也能打破反轉詛咒;在1B規模的Llama模型上,反轉任務成功率從近0%提升至約50%。
該研究證明反轉詛咒并非自回歸模型的本質限制,低成本的數據層面干預就能讓模型從"記事實"走向"懂關系",為大模型的邏輯推理能力研究開辟了新路徑。

論文鏈接:https://arxiv.org/abs/2602.02470
OSM+: Billion-Level OpenStreetMap Dataset for City-wide Experiments
道路網絡是城市的物理骨架,蘊含豐富的交通與地理信息。但處理全球OpenStreetMap原始數據計算量巨大,現有圖學習基準也難以覆蓋真實道路網絡的十億級規模與獨特拓撲特性。
上海交大、阿里云等團隊使用5000核分布式云計算處理全球OSM數據,推出了包含10億頂點的結構化數據集OSM+,并提供統一的數據結構、空間查詢接口與數據轉換工具。團隊還基于它構建了城市邊界檢測、31城市交通預測和六城市交通政策控制等下游任務與基準。
OSM+為城市計算、地理空間基礎模型訓練和大規模多智能體協同研究提供了堅實的數據基礎設施,降低了全球道路網絡數據的獲取門檻,也拓展了城市科學研究的可能性。

論文鏈接:https://openreview.net/forum?id=CMeeyJzWZ5
Learning Credal Ensembles via Distributionally Robust Optimization
大模型在部署時需要知道自己"不知道什么",但現有可信分類器常把認知不確定性(EU)簡單等同于隨機初始化帶來的模型分歧,這更多反映優化噪聲,而非數據分布變化帶來的真實不確定性。
研究團隊提出CreDRO,將EU重新定義為訓練和測試數據之間i.i.d.假設不同程度松弛下模型間的合理分歧。該方法采用分布魯棒優化學習可信集成,每個集成成員對應不同的魯棒參數,且無需修改神經網絡架構。
在OOD檢測、損壞數據評估和醫學選擇性分類等任務上,CreDRO一致優于現有深度集成和可信分類方法,對超參數與標簽噪聲也表現出良好魯棒性,為高風險場景下的模型部署提供了更可靠的"自知之明"。

論文鏈接:https://arxiv.org/abs/2602.08470
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
大語言模型的"幻覺"問題一直是應用痛點,而現有緩解方法往往在提升事實性的同時損害通用能力,"說真話"與"保持本事"難以兼得。
研究團隊提出二元檢索增強獎勵(Binary RAR)。與傳統連續獎勵不同,它僅在模型輸出與檢索證據文檔完全無矛盾時給予獎勵1,否則為0。在Qwen3-8B推理模型上,Binary RAR將長文本生成幻覺率從61.9%降至37.5%,PopQA和GPQA上的錯誤回答也分別大幅減少。
更難得的是,這些事實性提升幾乎沒有犧牲通用能力:指令遵循、數學推理和編程能力均保持穩定,模型還學會了在知識不足時策略性回答"我不知道"。這項工作為事實性對齊提供了一種簡潔且不易被"鉆空子"的解決方案。

論文鏈接:https://arxiv.org/abs/2510.17733
Copyright-Bench: Agentic Evaluation of Copyright Law Compliance
LLM智能體越來越多地承擔網站開發、商品設計、企業內容制作等商業任務,不可避免地會接觸外部內容。若未經授權使用受版權保護的材料,將帶來法律風險,但此前缺乏系統評估智能體版權合規能力的工具。
研究團隊推出Copyright-Bench,設計了貼近真實商業場景的任務,讓智能體在自由許可內容與版權內容之間做出選擇。評測還引入提示變化,模擬不同用戶意圖和時間壓力,以考察復雜情境下的表現。
實驗結果令人警醒:當前最先進的智能體即便存在合法替代方案,仍會做出侵犯版權的決策;而當用戶意圖更強或模擬時間壓力更大時,違規率還會進一步上升。Copyright-Bench為更安全、更守法的AI智能體提供了關鍵診斷工具。

論文鏈接:https://icml.cc/virtual/2026/poster/66009
Thinking in Flow: A Dissipative Stabilization Operator for Robust Autoregressive Reasoning
思維鏈讓大語言模型能逐步推理復雜問題,但長程生成過程卻十分脆弱:無關線索會不斷干擾,微小語義偏差會逐步累積成推理漂移,而臨時的后期修正又可能破壞整條思維軌跡。
研究團隊將自回歸解碼重新建模為受擾動的長程動力系統,提出"Thinking in Flow"(TiF)。TiF為Transformer增加輕量級神經ODE控制器,維持一個連續的"思維狀態",其動力學被顯式設計為耗散的,既能穩定累積證據,又能有控地遺忘無關信息。
在Llama和Qwen系列模型的數學推理基準上,TiF不僅在準確率上匹配或超越基線,還展現出對干擾和語義擾動的更強魯棒性。這項工作為長程自回歸推理的穩定性提供了新的理論視角和實用工具。

論文鏈接:https://icml.cc/virtual/2026/poster/65866
PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion
生成可以自由探索的360度虛擬世界,在游戲、虛擬現實、自動駕駛仿真等領域都有巨大潛力。但現有方法要么受限于窄視場,無法合成連續全景場景;要么相機控制精度不足,難以支持自由探索。
研究團隊提出PanoWorld-X框架。他們在虛幻引擎504個高保真3D場景中采集了11.6萬條全景視頻序列,并引入球面感知擴散Transformer:將等距矩形投影特征重投影到球面,通過球面距離計算鄰域關系,從而解決全景圖像邊緣和極地在2D投影中被割裂的問題;同時通過探索感知注意力實現精確軌跡控制。
在PSNR、SSIM、LPIPS、FID、FVD等多項指標上,PanoWorld-X全面超越現有全景視頻生成和相機可控生成方法,讓"可任意探索的AI生成世界"更近了一步。

論文鏈接:https://arxiv.org/abs/2509.24997
Beyond Log Likelihood: Probability-Based Objectives for Supervised Fine-Tuning across the Model Capability Continuum
監督微調(SFT)是大語言模型后訓練的標準方法,但其默認目標——負對數似然(NLL)——并非在所有情況下都最優。后訓練階段,模型已編碼任務相關先驗,監督數據也可能既長又嘈雜,NLL的某些最優性假設可能不再成立。
論文系統研究了多種基于概率的目標函數,提出"模型能力連續譜"這一關鍵概念:當任務被預訓練充分覆蓋(模型強端)時,強調高概率token的?p目標一致優于NLL;當任務幾乎不在預訓練中出現(模型弱端)時,NLL通過糾正低概率token而占優;在兩者之間,沒有單一目標始終最強。
這一規律在8個模型骨干、27個基準、7個領域的實驗中得到驗證。該研究打破了"NLL是SFT默認最優選擇"的慣性認知,為根據基礎模型能力選擇微調目標提供了理論依據和實踐指南。

論文鏈接:https://arxiv.org/abs/2510.00526
Provably Convergent Actor-Critic for MARL through Risk-aversion
在多智能體強化學習(MARL)中,學習穩定且可收斂的聯合策略一直是核心難題。經典博弈論均衡在一般和馬爾可夫博弈中的平穩形式往往計算不可行,而單智能體RL或零和博弈中的成熟結論在多智能體場景下也難以直接遷移。
研究團隊將目光投向行為博弈論中的"風險厭惡量化響應均衡"(RQE)。RQE同時考慮智能體的風險厭惡心理和有限理性特點,具有優良的正則性條件。基于這一概念,作者提出了一種單時間尺度的Actor-Critic算法:actor更新較快,critic更新較慢,并嚴格證明了該算法在有限樣本下能夠實現全局收斂。
多個多智能體環境中的實驗驗證了該算法相比風險中性基線具有更優的收斂性質。這項工作為MARL的理論基礎貢獻了新的收斂保證,也為設計更穩健的多智能體學習算法開辟了風險厭惡的新視角。

論文鏈接:https://ui.adsabs.harvard.edu/abs/2026arXiv260212386Z/abstract
以上9篇論文從理論、方法、數據、評測到應用,展現了ICML 2026多元而活躍的研究圖景。雷峰網(公眾號:雷峰網)與AI科技評論將持續在現場為大家帶來更多一線報道,如有遺漏或希望進一步交流,歡迎聯系我們!
一個人讀論文太孤單,一群人刷頂會才好玩。
ICML 2026 召開在即,我們正在召集一波含金量極高的 AI 研究者。群內主打實時論文跟蹤與硬核技術探討,拒絕灌水。
? 進群傳送門: 掃碼進群或添加微信Vin_Vivid,備注:論文群 + 關注的 AI 方向。

搞科研/搞技術,信息差很重要。
來,一起快人一步!
上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。