0
| 本文作者: 陳淑瑜 | 2026-07-28 17:29 | 專題:IJCAI:國際人工智能聯合會議 |

編輯丨岑峰
花費上億美元、集結頂尖算力訓練出的大模型,正面臨被惡意蒸餾、套殼甚至竊取核心數據的巨大風險。
就在2026年近期,Anthropic 公開披露了針對 Claude 的大規模疑似惡意蒸餾事件——攻擊者利用欺詐賬戶和代理服務瘋狂收集模型輸出,試圖低成本復制大模型的能力。殘酷的現實證明:面對隱蔽的“白嫖”與盜用,僅靠賬戶封禁、訪問控制等外部防御手段,已經防不勝防。
數據從何而來?模型是否被惡意克隆?這篇爆火的AI爽文到底是誰生成的?
為了回答這三個終極安全問題,建立一套嚴密的大語言模型(LLM)“身份認證”機制迫在眉睫。近日,來自西安交通大學、中國科學院信工所和澳大利亞迪肯大學的研究團隊,在人工智能頂會 IJCAI 2026 發表了題為“Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content”的重磅綜述論文,首次提出了大模型“隱式身份(Implicit-ID)”的統一理論框架。
該研究徹底厘清了行業內長期混淆的“水印”與“指紋”技術,系統梳理了貫穿數據集、模型、生成內容全生命周期的身份認證方案,為構建可信、安全、可追溯的大模型生態提供了全景式的技術指南。
論文作者來自西安交通大學、中國科學院信息工程研究所和澳大利亞迪肯大學,包括劉冰、王順平、朱煜帆、余欣怡、黃晶、杜林康、裴紅斌(通信作者)和羅瑋。
arXiv 預印本:https://arxiv.org/abs/2605.29245

01
大語言模型的研發需要投入大量的數據、算力與工程資源,有公開報道和研究估算認為,GPT-4的訓練成本達到億美元量級。隨著模型能力、應用范圍和商業價值不斷提升,與大模型相關的安全與治理問題也日益突出,包括模型參數泄露、未經授權使用、訓練數據違規利用、模型輸出濫用,以及生成內容來源難以識別等。
2026年以來,圍繞模型輸出使用邊界與模型蒸餾合規性的討論受到廣泛關注。Anthropic公開稱,其發現了利用欺詐賬戶和代理服務大規模訪問Claude、收集模型輸出并規避檢測的疑似模型蒸餾活動。該事件凸顯了僅依賴賬戶管理、訪問控制和外部行為檢測保護模型資產所面臨的局限,迫切需要建立支持大語言模型資產保護與來源追溯的身份機制,從而回答三個基本問題:
數據集是否遭到未經授權的使用?
模型來自何處,是否經過復制、微調或其他改造?
內容是否由特定模型或某類模型生成?
指紋識別(Fingerprinting)與水印技術(Watermarking)由此迅速成為研究熱點。然而,現有研究長期存在兩大突出問題:一是概念邊界不夠清晰,不同文獻對“指紋”和“水印”的定義存在交叉甚至混用;二是研究體系相對分散,數據集保護、模型所有權認證和生成內容檢測通常被分別研究,缺少覆蓋大模型全生命周期的統一視角。
針對這些問題,該綜述提出大語言模型“隱式身份”這一統一框架,系統梳理大語言模型從數據、模型到生成內容的身份技術。

02
論文提出了由“頂層概念-中層實現-底層機制”三個層次構成的概念框架。
在頂層,論文提出隱式身份作為統一抽象,用于描述大語言模型系統中不易被直接觀察、但能夠通過特定驗證程序識別和確認的身份信號。大模型的身份需隱藏在參數、表示、行為響應或生成內容的統計規律中,需要借助特定算法、測試樣本或密鑰才能驗證,因此被稱為“隱式身份”。這一概念將原本分散的指紋和水印技術納入同一理論框架,使研究者能夠從“身份如何產生、證據從何而來、聲明如何驗證”三個基本問題出發,對不同方法進行統一分析。
在中層,論文根據身份信號的形成方式,將隱式身份劃分為兩種主要實現形式。指紋技術(Fingerprinting)是一種非侵入式身份技術,其身份信號來源于數據集、模型或生成內容自身固有的內在特征,例如模型的參數分布、內部表示、輸入—輸出行為模式或生成內容的統計特征,無需對原始資產進行主動修改。水印技術(Watermarking)則是一種侵入式身份技術,通過外部干預,將預先設計、可驗證的身份信號主動嵌入數據集、模型或生成內容中。簡言之,指紋識別是從資產的固有特征中“提取身份”,后通過相似性比較歸因實現驗證;而水印技術是在資產中主動“植入身份”,后通過密鑰進行身份驗證。
在底層,論文從證據來源和驗證路徑兩個方面歸納現有方法,形成一個緊湊的隱式身份技術設計空間。不同方法所利用的身份依據可能來自數據集中的記憶與統計信號、模型參數及其統計不變量、模型內部表示與梯度、特定輸入下的行為響應,以及生成內容中的詞匯、句法、語義或分布特征。與之對應,驗證路徑主要包括兩類:一類是不依賴預設密鑰的相似性歸因,即提取待驗證資產的內在證據,并與候選來源的參考證據進行匹配;另一類是依賴預先嵌入身份信號和秘密信息的密鑰驗證,即通過相應檢測器判斷特定水印是否存在。
這一框架不僅澄清了長期存在的術語混淆問題,也為比較不同訪問條件下的身份技術,以及推動方法、攻擊模型和評估標準在數據集、模型與生成內容之間遷移復用,提供了分析基礎。

03
資產保護不應頭痛醫頭、腳痛醫腳。論文提出了一套橫跨大語言模型生命周期與驗證語義的二維分類體系(Taxonomy):
生命周期維度:按照身份建立或驗證所處的資產階段,將相關技術劃分為數據集、模型和生成內容三個層面;
身份驗證維度:根據驗證語義區分為基于相似性的歸因(對應非侵入式的指紋識別)與基于密鑰的驗證(對應侵入式的水印技術)。資產保護與來源追溯并不分別綁定于某一種技術,而是均可通過上述兩種驗證路徑實現。
這種“生成性”的分類法不僅對現有研究進行歸類,還揭示了不同資產層面之間共享的驗證邏輯,從而幫助研究者推導方法、攻擊模型和評估壓力條件在不同生命周期階段之間的遷移關系。

各資產層面的技術要點如下:
數據集層面:重點關注數據集指紋識別,包括統計指紋(基于損失、困惑度等記憶信號)和特定響應指紋,主要用于事后數據使用審計和所有權驗證;
模型層面:技術最為豐富,涵蓋參數空間指紋、表示空間指紋、行為指紋,以及通過微調、模型編輯等方式嵌入身份信號的模型水印方法;
生成內容層面:包括統計指紋、自然指紋,以及統計水印(紅綠列表等)和帶密鑰采樣水印(零失真水印等),可直接對輸出文本進行溯源。

04
為了讓身份驗證系統真正落地工業界,論文進一步建立了一套包含四個核心評估目標的評估框架,將隱式身份做為大模型身份驗證的“體檢標準”系統:
1.身份聲明正確性(Correctness of Identity Claims)衡量驗證系統能否接受真實聲明、拒絕虛假聲明。論文以真陽性率(TPR)和假陽性率(FPR)為核心指標,建議報告固定FPR下的TPR,或使用ROC曲線、精確率—召回率曲線進行評估;多源歸因場景還應關注Top-k準確率和置信度校準。
2.良性變換魯棒性(Robustness to Benign Transformations)衡量身份信號在數據處理、模型微調、量化、剪枝、蒸餾、模型合并,以及文本改寫、翻譯和摘要等正常變換后能否繼續被驗證。論文提出良性魯棒性覆蓋率,用于匯總身份方法在不同良性變換下保持有效的比例。
3.對抗操縱魯棒性(Security against Adaptive Manipulation)評估身份技術面對移除、規避、偽造和冒充攻擊時的安全性。論文強調應明確攻擊者的知識、權限和能力,并以對抗魯棒性覆蓋率衡量方法在給定威脅模型下抵抗不同攻擊的能力。
4.效用與部署成本(Utility and Deployment Cost)衡量身份技術對原有功能的影響及其實際應用代價。水印技術需重點評估嵌入身份信號造成的性能或文本質量下降;指紋識別通常不直接影響資產效用,但可能需要較高的查詢、計算和存儲開銷。部署成本進一步分為身份建立成本和身份驗證成本。前者包括數據構造、模型微調、模型編輯、解碼干預和密鑰管理等;后者包括查詢次數、計算與存儲開銷、驗證延遲及訪問權限要求。即使方法具有較高識別性能,若依賴白盒訪問或大量查詢,也可能難以實際部署。
這一評估框架為后續研究提供了系統、可比較的評估模板,有助于推動領域向更規范、更實用的方向發展。

05
盡管大語言模型身份技術突飛猛進,但該綜述也指出了當前行業面臨的三大痛點:
一是身份安全信息與模型效用的“蹺蹺板”,即如何在不犧牲模型聰明程度的前提下打上強力水印;二是對跨生命周期漂移和自適應變換的魯棒性不足,面對模型迭代演化與自適應攻擊,身份信號極易發生“漂移”和失效;三是驗證過程往往需要極高的白盒權限或者算力開銷、缺乏低成本且標準化的評測基準。
未來,語義保真度更高的身份機制、對模型演化和內容變換更加魯棒的身份信號、更加高效且可審計的驗證方法,以及覆蓋數據集、模型和生成內容的評測基準,將是下一個黃金研究方向。

06
隨著大語言模型滲透進千行百業,如何實現模型、數據和生成內容的身份認證、知識產權保護與來源追溯,已成為可信人工智能不可回避的重要基礎設施建設。這篇 IJCAI 2026 的重磅綜述,梳理了隱式身份技術的發展脈絡、統一框架和未來方向,為構建安全、可信、可追溯的大語言模型生態提供了參考。
論文完整版預印本請訪問arXiv:https://arxiv.org/abs/2605.29245,進一步了解這一快速發展的研究方向。
雷峰網(公眾號:雷峰網)
雷峰網特約稿件,未經授權禁止轉載。詳情見轉載須知。
本專題其他文章