0
| 本文作者: 陳淑瑜 | 2026-06-01 15:41 | 專(zhuān)題:CVPR 計(jì)算機(jī)視覺(jué)與模式識(shí)別會(huì)議 |
來(lái)源:公眾號(hào)“AI上分搭子
原文鏈接:https://mp.weixin.qq.com/s/6VviwXMsnFYLQHkVKMUZ3w
LILA 盯的是一個(gè)很基礎(chǔ)、但常常被繞開(kāi)的點(diǎn):
視覺(jué) foundation model 很強(qiáng),但很多輸出仍然是 patch-level feature。
做分類(lèi)、檢索,patch feature 很夠用。
但做 video object segmentation、surface normal、semantic segmentation,就會(huì)卡在更細(xì)的地方:
邊界、幾何、跨幀一致性。
LILA 的辦法是從未標(biāo)注視頻里學(xué) pixel-level feature。
它不需要人工 mask。
也不要求推理時(shí)輸入視頻。
訓(xùn)練時(shí),它借用 off-the-shelf 模型給出的 depth、optical flow,再加上 self-distillation cue。
核心機(jī)制叫 linear in-context learning。
簡(jiǎn)單說(shuō):
在一幀上學(xué)到的“從特征讀出 cue 的線性規(guī)則”,換到相鄰幀也應(yīng)該成立。
先看幾組數(shù)字:
DINOv2、DINOv3 這類(lèi)視覺(jué) foundation model 已經(jīng)很強(qiáng)。
它們的特征里有語(yǔ)義,也有不少幾何信息。
問(wèn)題在于,很多 encoder 的輸出仍然是 patch grid。
一個(gè) patch 里有很多像素。
當(dāng)任務(wù)需要細(xì)邊界、局部幾何、跨幀對(duì)應(yīng)時(shí),patch-level feature 就有點(diǎn)粗。
當(dāng)然,也可以把輸入圖像放大,或者用后處理方法上采樣 feature。
但這會(huì)帶來(lái)兩個(gè)麻煩:
LILA 的目標(biāo)更直接:
讓模型天然輸出每個(gè)像素一個(gè) feature。
而且這個(gè) feature 不只是“看起來(lái)更細(xì)”。
它還要帶有三類(lèi)信息:
視頻在這里就派上用場(chǎng)了。
視頻天然有運(yùn)動(dòng),也隱含 3D 幾何。
如果能把這些線索轉(zhuǎn)成訓(xùn)練信號(hào),就有機(jī)會(huì)補(bǔ)上 image-only pretraining 缺少的部分。

LILA 用了 depth 和 optical flow。
但它并不是簡(jiǎn)單訓(xùn)練模型去預(yù)測(cè) depth 和 flow。
這點(diǎn)要先說(shuō)清楚。
因?yàn)檫@些 cue 本身有噪聲。
off-the-shelf depth / flow 模型在很多視頻上能用,但不可能每個(gè)像素都準(zhǔn)。
如果直接把 noisy cue 當(dāng)答案蒸餾,模型很容易連噪聲一起學(xué)進(jìn)去。
LILA 換了一個(gè)問(wèn)法:
如果一幀里的 feature 真的學(xué)到了穩(wěn)定結(jié)構(gòu),那么從這幀 feature 到 cue map 的線性映射,換到相鄰幀也應(yīng)該還能用。
這就是 linear in-context learning。
它學(xué)的不是 depth 或 flow 本身。
它學(xué)的是一種 pixel feature:
同一個(gè)線性讀出器,在相鄰幀里也能解釋它。
約束很輕,但視頻里的時(shí)間一致性被用進(jìn)來(lái)了。

LILA 從一個(gè)預(yù)訓(xùn)練 ViT 出發(fā),比如 DINOv2。
encoder 凍住。
只訓(xùn)練一個(gè) DPT decoder。
這個(gè) decoder 通過(guò) skip connections,把 patch-level token 上采樣成 pixel-level feature map。
訓(xùn)練時(shí),每次取一對(duì)相鄰幀:
模型分別輸出:
監(jiān)督信號(hào)來(lái)自三類(lèi) cue:
cue map 的構(gòu)造可以寫(xiě)成:
這里的 和 是對(duì)應(yīng) crop。
是 refine 后的 encoder feature, 是 depth, 是 optical flow。
接著,在 context frame 上求一個(gè)線性映射:
然后要求同一個(gè) 也能解釋 query frame:

換個(gè)更直觀的說(shuō)法:
context frame 先給出一個(gè)“小考題”:
這個(gè) feature 里能不能線性讀出 depth、motion 和 encoder cue?
query frame 接著驗(yàn)證:
同一套讀出規(guī)則,換一幀還成立嗎?
如果成立,說(shuō)明 feature 里學(xué)到的不是單幀噪聲,而是更穩(wěn)定的時(shí)空結(jié)構(gòu)。
主結(jié)果覆蓋三個(gè)方向:

在 DINOv2-S14 上:
| 68.6 | 73.9 |
LILA 的優(yōu)勢(shì)不只是 linear probe。
local k-NN 也明顯提高。
這說(shuō)明它不只是讓類(lèi)別更容易線性讀出來(lái),也讓跨幀像素匹配更穩(wěn)。
DINOv2-B14 上,LILA 也超過(guò) FlowFeat:
| 70.4 | 74.2 |

Table 2 說(shuō)明,LILA 并不是只為 VOS 調(diào)出來(lái)的。
在 surface normal estimation 上,RMSE 越低越好:
| 25.71 |
COCO-Stuff 上,mIoU 越高越好:
| 62.4 |
DINOv2-L14 + Kinetics 這一行也值得看。
LILA 的 COCO-Stuff mIoU 到 63.3。
這說(shuō)明擴(kuò)大視頻數(shù)據(jù)后,語(yǔ)義表征還能繼續(xù)漲。

Table 3 補(bǔ)了兩個(gè)測(cè)試。
ADE20K 上:
| 45.1 | |
| 47.5 |
zero-shot COCO-Stuff 上,DINOv2-B14 的 harmonic mIoU:
這說(shuō)明 LILA 學(xué)到的 dense feature,對(duì) unseen classes 也有幫助。

Table 4 看 cue modality。
只用 self-distillation 時(shí),VOS local k-NN J&F 是 68.6。
加入 depth 或 flow 后都會(huì)漲。
三種 cue 一起用,local k-NN J&F 到 73.9。
這說(shuō)明 depth、motion、encoder feature 是互補(bǔ)的。

Table 5 更關(guān)鍵。
它比較了 LILA 和直接預(yù)測(cè)外部 cue 的 ERM distillation。
| 68.6 / 73.9 | 28.53 | 59.6 |
兩者用的是類(lèi)似 cue。
差別在于:ERM 直接學(xué) noisy cue,LILA 用跨幀線性一致性過(guò)濾噪聲。
這個(gè)差距說(shuō)明,linear in-context learning 本身不是裝飾。它確實(shí)在起作用。
其他組件也有貢獻(xiàn):

Figure 7 看 temporal gap。
太小,任務(wù)太容易,學(xué)到的表征反而弱。
變大后,cue predictability 更難,但精度是平滑下降。
這說(shuō)明 LILA 確實(shí)在利用視頻里的時(shí)間間隔,而不是只做單幀蒸餾。

Figure 5 適合講兩個(gè)點(diǎn):

Figure 6 值得放在“注意點(diǎn)”附近。
它有兩個(gè)信息:
這張圖也能提醒讀者:別把方法理解成“哪里都無(wú)腦好”。
LILA 強(qiáng),但它確實(shí)依賴(lài) depth / flow cue 的適用范圍。
LILA 的信息可以壓成一句話(huà):
未標(biāo)注視頻里的 depth 和 motion,不只是訓(xùn)練目標(biāo),也可以變成 pixel-level representation learning 的橋。
它沒(méi)有推翻 DINOv2 這類(lèi)大 encoder。
更像是給它們補(bǔ)了一個(gè) dense decoder。
encoder 負(fù)責(zé)強(qiáng)語(yǔ)義。
decoder 負(fù)責(zé)把語(yǔ)義、幾何和時(shí)間一致性落到每個(gè)像素。
這條路線的好處是很實(shí)用:
訓(xùn)練時(shí)用視頻。
推理時(shí)只要單張圖。
不需要人工 mask。
結(jié)果也不是只在一個(gè) benchmark 上變好,而是在 VOS、surface normal、semantic segmentation 上一起提升。
代碼 / 項(xiàng)目頁(yè):
https://github.com/google-research/google-research/tree/master/lilahttps://lila-pixels.github.io項(xiàng)目頁(yè)和 GitHub 已放出代碼與 pretrained checkpoints。
我覺(jué)得這篇最值得看的地方,是它很清楚地補(bǔ)了 foundation model 的一個(gè)短板。
大 encoder 已經(jīng)有強(qiáng)語(yǔ)義。
但 dense tasks 需要的是每個(gè)像素都可靠。
LILA 沒(méi)有強(qiáng)行重訓(xùn)整個(gè) foundation model,而是凍結(jié) encoder、訓(xùn)練 decoder,用視頻里的 depth / flow cue 把 pixel detail 補(bǔ)上。
這個(gè)選擇很克制,也很工程。
LILA 依賴(lài) off-the-shelf depth 和 optical flow。
如果這些 cue 在域外場(chǎng)景里不可靠,feature 也可能受影響。
Figure 6 里的 aerial image 就是一個(gè)提醒。
另外,很多結(jié)果是 probing 設(shè)置。
它證明了 representation 更好,但真正接到復(fù)雜下游系統(tǒng)時(shí),還要看 task head、訓(xùn)練數(shù)據(jù)和部署場(chǎng)景。
第一個(gè)方向,是接更多 backbone。
附錄 Table 6 已經(jīng)顯示,MAE-B16、DINOv2-Reg、DINOv3 上都能有提升,只是幅度不同。
第二個(gè)方向,是引入更多 cue。
比如更強(qiáng)的 3D cue、object permanence、interaction signal,甚至來(lái)自機(jī)器人交互的視頻反饋。
第三個(gè)方向,是把 LILA 這種 dense decoder 變成視覺(jué) foundation model 的標(biāo)準(zhǔn)配件。
本專(zhuān)題其他文章