0
| 本文作者: 陳淑瑜 | 2026-07-28 17:44 | 專題:IJCAI:國際人工智能聯合會議 |
來源:TJUNLP
原文鏈接:https://mp.weixin.qq.com/s/CSQhDdBV97iaaTl46zUVrg
近期,天津大學自然語言處理實驗室(TJUNLP)在多個國際頂級學術會議上取得佳績,共有4篇論文分別被AAAI 2026、ICML 2026、IJCAI-ECAI 2026和ICASSP 2026接受。研究內容涵蓋大模型可解釋性與機器翻譯、多語言安全對齊、參數高效微調、以及大模型安全與后門攻擊等多個前沿方向。
第40屆AAAI人工智能會議(The 40th AAAI Conference on Artificial Intelligence, AAAI 2026)已于2026年1月20日至27日在新加坡舉辦。AAAI是人工智能領域最具影響力的國際學術會議之一,是中國計算機學會(CCF)推薦的A類國際學術會議。
第43屆國際機器學習會議(The 43rd International Conference on Machine Learning, ICML 2026)將于2026年7月6日至11日在韓國首爾舉辦。ICML是機器學習領域的頂級國際學術會議,是CCF推薦的A類國際學術會議。
第35屆國際人工智能聯合會議(The 35th International Joint Conference on Artificial Intelligence, IJCAI-ECAI 2026)將于2026年8月15日至21日在德國不來梅舉辦。IJCAI是人工智能領域歷史最悠久的頂級國際學術會議之一,是CCF推薦的B類國際學術會議。
第51屆IEEE國際聲學、語音與信號處理會議(The 51st IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP 2026)將于2026年5月4日至8日在西班牙巴塞羅那舉辦。ICASSP是信號處理領域最具影響力的學術會議,是CCF推薦的B類國際學術會議。
1
Finding the Translation Switch: Discovering and Exploiting the Task-Initiation Features in LLMs
會議:AAAI 2026
作者:吳新維*,劉恒*,趙小虎,任玉琪,徐林龍,王龍躍,熊德意,駱衛華,張凱夫
大語言模型(LLMs)即使未經任務特定的微調,也常常展現出強大的翻譯能力。然而,支配這一內在能力的內部機制在很大程度上仍不透明。為了揭示這一過程,本文利用稀疏自編碼器(SAEs)并引入了一個用于識別任務特定特征的新框架。該方法首先召回在翻譯輸入上頻繁共同激活的特征,然后使用基于PCA的一致性指標對其進行功能一致性過濾,成功分離出一小組"翻譯啟動"特征。因果干預實驗表明,增強這些特征的激活可以引導模型產生正確的翻譯,而消融這些特征則會導致幻覺和偏離任務的輸出,從而證實它們是模型內在翻譯能力的核心組成部分。進一步地,本文利用這一機制性洞見提出了一種新的數據選擇策略,優先在"機制上困難"的樣本上進行訓練,顯著提升了數據效率并抑制了幻覺。此外,這些機制可以遷移到同一模型家族中更大規模的模型上。

2
Multilingual Safety Alignment via Representation-Space Separability
會議:ICML 2026
作者:史丹*,韓卓文*,熊德意
大語言模型(LLMs)已被全球各類場景廣泛采用,因此,穩健的多語言安全對齊是確保其在不同語言中可靠部署的前提條件。盡管近期取得了諸多進展,但LLMs在高資源語言和低資源語言之間仍存在顯著的安全差距:能夠在高資源語言中持續拒絕有害請求的模型,在低資源語言中往往無法做到這一點。在這項工作中,我們揭示了此類安全失敗源于低資源語言中,有害請求與無害請求在表示空間上的可分性不足。通過幾何分析,我們發現與英語相比,有害提示與無害提示表示之間的分離程度顯著降低,并且由此產生的跨語言空間距離差距與攻擊成功率密切相關。基于這些見解,我們提出了一種新型的訓練策略——多語言空間距離差距優化(Multilingual Spatial Margin Gap-based Optimization,SMO)。它利用主導語言(如英語)中良好對齊的安全幾何結構,來增強其他低資源語言的安全對齊效果。SMO 明確利用英語與目標語言之間的空間距離差距作為逐樣本的監督信號,在保持主導語言原始性能的同時,實現了安全能力的有效跨語言遷移。在 LLaMA-3.1-8B-Instruct 和 Qwen2.5-7B-Instruct 上進行的實驗表明,SMO 能夠大幅降低低資源語言中的攻擊成功率(Attack Success Rates, ASR)至接近甚至達到零,同時保持了強大的通用多語言性能。

3
SeMi-LoRA: Enhancing Low-Rank Adaptation via Separation and Mixing
會議:IJCAI-ECAI 2026
作者:楊振飛,于北溟,林佩勤,劉永康,熊德意
低秩適配(LoRA)已成為參數高效微調(PEFT)的標準范式。然而,其低秩約束會限制表達復雜權重更新的能力,導致與全量微調相比存在性能差距。近期的擴展方法雖然提升了表達能力,但往往犧牲了參數可合并性,或依賴于稀疏的塊對角更新,從而阻礙了全局信息流動。我們提出了SeMi-LoRA(分離與混合LoRA),這是一個能夠在保持可合并性的同時實現完整高秩更新的新框架。SeMi-LoRA 將適配過程解耦為通道級壓縮,隨后進行兩階段的隱空間混合(秩混合和通道混合)。我們的結構分析表明,在固定基礎秩的條件下,有效更新秩隨通道數量線性增長,并且支持完整更新而非部分稀疏更新。在常識推理、數學推理和自然語言理解基準上的大量實驗表明,SeMi-LoRA 在提升參數效率的同時,始終優于強大的PEFT基線方法。

4
SatBadEdit: Towards Efficient and Robust Multi-Trigger Backdoor Injection in Large Language Models
會議:ICASSP 2026
作者:陳越,趙小虎,吳新維,彭鑒翔,史丹,楊磊,徐林龍,孫越恒,熊德意
向大語言模型(LLMs)進行高效且隱蔽的后門注入仍然是一個關鍵挑戰。雖然近期的模型編輯技術提供了一種比傳統微調更高效的替代方案,但它們通常僅限于注入少量觸發器,且對現有的防御機制表現出較差的魯棒性。為克服這一局限,我們提出了SatBadEdit,一種基于飽和的新型模型編輯方法,用于植入大量具有高對抗強度的后門。SatBadEdit 獨特地利用批量編輯能力,在單次高效操作中注入大量觸發器。為了抵消大規模注入可能帶來的模型不穩定性,我們設計了一種低秩權重更新與聚合策略。該機制將參數修改限制在稀疏的低維子空間內,在最大化觸發器有效性和穩定性的同時,確保對模型的干擾最小。實驗表明,SatBadEdit 不僅在效率和隱蔽性方面超越了現有的微調和基于編輯的攻擊方法,而且在多種主流防御機制下仍保持較高的攻擊成功率。

/ 關于我們 /
天津大學自然語言處理實驗室在熊德意教授的帶領下,開展大語言模型、機器翻譯、AI對齊、AI for Science等方向的研究,建立了省部級科技創新合作平臺,承擔了國家重點研發計劃等多項重要研究項目。實驗室具備AI大模型全棧研發能力,覆蓋數據采集與處理、基座模型訓練、AI對齊、模型評測及應用部署大模型全生命周期,已自主研制中文大模型仁文伏羲、多語言大語言模型FuxiTranyu(覆蓋40+語種并實現基座及對齊模型全開源)及DNA大模型。實驗室圍繞大模型安全、對齊及評測,積累了深厚的大模型安全可控技術,發布了數百頁的大模型安全、對齊與評測全面報告,構建了大模型評測平臺OpenEval及多個大模型安全評測基準,聯合發布了大模型基準測試白皮書。實驗室致力于為AI大模型構筑全面和多維度安全可控體系,助推AI大模型能力與安全協同發展!
本專題其他文章