0
| 本文作者: 吳思?jí)?/a> | 2026-06-29 10:22 | 專題:ICML:國(guó)際機(jī)器學(xué)習(xí)會(huì)議 |
原文作者:公眾號(hào)“學(xué)術(shù)摘星人的每日簽”
原文鏈接:https://mp.weixin.qq.com/s/JoWhUDPK4mfIqLNBKP0wyA
雷峰網(wǎng)(公眾號(hào):雷峰網(wǎng))轉(zhuǎn)載
眾所周知,Supervised Fine-Tuning (SFT) 是讓多模態(tài)大模型聽(tīng)懂人話、對(duì)齊人類意圖的關(guān)鍵步驟。但在享受指令微調(diào)帶來(lái)的紅利時(shí),你有沒(méi)有想過(guò):如果微調(diào)數(shù)據(jù)被“投毒”了怎么辦? 近期研究表明,LVLMs 在 SFT 階段極易遭受后門攻擊(Backdoor Attacks)。攻擊者只需在訓(xùn)練集的圖片或指令中混入微小的觸發(fā)器(Trigger),就能讓模型在特定場(chǎng)景下瞬間“失智”,輸出惡意的預(yù)設(shè)回復(fù)。面對(duì)這種開(kāi)放式生成場(chǎng)景下的暗箭,傳統(tǒng)的防御手段幾乎全軍覆沒(méi)。
今天為大家拆解的這篇 ICML 2026 新文 BYORn (Bootstrap Your Own Responses),就巧妙地利用了模型自身的“直覺(jué)”,提出了一種無(wú)需清洗數(shù)據(jù)就能直接在毒化數(shù)據(jù)集上練就“百毒不侵”之軀的防御框架。

在理想狀態(tài)下,標(biāo)準(zhǔn)的 SFT 本質(zhì)上是一個(gè)風(fēng)險(xiǎn)最小化問(wèn)題,我們希望最小化無(wú)偏的風(fēng)險(xiǎn)估計(jì):
其中, 是圖片, 是指令文本, 是干凈的輸出目標(biāo)。
然而,在現(xiàn)實(shí)的對(duì)抗場(chǎng)景中,我們拿到的往往是一個(gè)被投毒的數(shù)據(jù)集 。其中有 比例的數(shù)據(jù)被攻擊者動(dòng)了手腳,植入了 Trigger,并且對(duì)應(yīng)的響應(yīng) 被篡改為了惡意目標(biāo)。如果在這種數(shù)據(jù)上直接優(yōu)化負(fù)對(duì)數(shù)似然,模型就會(huì)精準(zhǔn)地學(xué)到 Trigger 和惡意響應(yīng)之間的映射關(guān)系。
多模態(tài)指令微調(diào)的數(shù)據(jù)包含文本和圖像交織的復(fù)雜語(yǔ)義空間。攻擊者可以把 Trigger 藏在圖片的隨機(jī)噪聲里,或者藏在提問(wèn)的一個(gè)不起眼的亂碼單詞中。要想在不知道攻擊模式的情況下進(jìn)行普適性防御,無(wú)異于大海撈針。
作者的破局點(diǎn)非常直觀且巧妙:再狡猾的后門,它的惡意響應(yīng)和輸入本身也是不搭調(diào)的。 比如,圖片明明是一只狗在滑板上,惡意的 Target 卻非要逼模型回答“圖片里是一個(gè)香蕉”。這種語(yǔ)義失調(diào),逃不過(guò)預(yù)訓(xùn)練基座模型的“火眼金睛”。

作者定義了一個(gè)基于生成困惑度的檢測(cè)分?jǐn)?shù):
利用預(yù)訓(xùn)練參數(shù) ,計(jì)算目標(biāo)響應(yīng) 的困惑度。因?yàn)閻阂忭憫?yīng)往往與圖文上下文毫無(wú)邏輯關(guān)聯(lián),它的 分?jǐn)?shù)會(huì)顯著偏高。通過(guò)設(shè)定一個(gè)分位數(shù)閾值 ,我們可以識(shí)別出高度疑似毒化的樣本(指示變量 )。
如果直接把可疑樣本扔掉(作者稱之為 BYORn-F 基線),模型性能會(huì)受損。因此,BYORn 框架引入了一個(gè)平滑演進(jìn)的模型副本(即參數(shù)的指數(shù)移動(dòng)平均 )。 在訓(xùn)練時(shí),對(duì)于檢測(cè)為干凈的樣本,用原有的 計(jì)算 Loss;對(duì)于被判定為毒化的樣本,不再使用數(shù)據(jù)集中自帶的惡毒答案,而是讓 現(xiàn)場(chǎng)動(dòng)態(tài)生成一個(gè)替代響應(yīng) ,并用這個(gè)生成的 來(lái)做反向傳播。
由此,得到全新的目標(biāo)函數(shù):
作者并非只是憑經(jīng)驗(yàn)拍腦袋,而是提供了堅(jiān)實(shí)的理論支撐。通過(guò)結(jié)合 Donsker-Varadhan 上界和 Hoeffding 引理,作者在論文中嚴(yán)密推導(dǎo)證明了:優(yōu)化這個(gè)引入了潛變量的 目標(biāo),在數(shù)學(xué)上完全等價(jià)于在不可見(jiàn)的“真實(shí)干凈數(shù)據(jù)分布”上最小化群體風(fēng)險(xiǎn)(Population Risk)上界的經(jīng)驗(yàn)估計(jì)。
這也就解釋了為什么用自己生成的偽標(biāo)簽去學(xué),不僅成功破壞了 Trigger 的關(guān)聯(lián),還能反向促進(jìn)模型在主任務(wù)上的泛化。


作者在 LLaVA、Qwen-VL、InternVL 等多個(gè)當(dāng)紅模型上,橫跨圖像描述(Image Captioning)、找不同(Spot the Difference)和視覺(jué)問(wèn)答(VQA)三大任務(wù)進(jìn)行了測(cè)試。








這篇論文在思路上有一種“以子之矛攻子之盾”的美感,它告訴我們:多模態(tài)大模型本身的常識(shí)儲(chǔ)備,就是最好的安全防火墻。

本專題其他文章