0
| 本文作者: 袁毓婉 | 2026-07-30 16:23 | 專題:IJCAI:國際人工智能聯合會議 |
來源:公眾號"新智元"(ID: AI_era)
原文鏈接:https://hub.baai.ac.cn/view/55906

新智元報道

多模態大模型正試圖從「看畫面」進化到「懂世界」。但面對動輒數小時的真實業務長視頻,所有大模型玩家都撞上了一堵極其現實的高墻:視頻那么長,算力那么貴,幀,到底該怎么選?
為了妥協算力,目前的行業慣例是「均勻采樣」——讓模型每隔幾秒機械地「睜一次眼」。但這套看似公平的邏輯,在通信等復雜領域場景中卻顯得極為脆弱。因為業務事件的發生,從不按照節拍器來。

在專業的領域視頻中,「看滿全場」絕不等于「看懂細節」。關鍵事件在時間軸上極度「非均勻分布」,這導致均勻采樣常常在兩個極端里反復橫跳:
這逼出了一個終極拷問:能不能讓模型在不知道提問的前提下,自己判斷「哪些畫面最值得看」?

面對這一行業共性難題,華為GTS研發部AI數據團隊給出了全新解法——LFS(Learnable Frame Selector,可學習幀選擇器)。
LFS打破了「按時間間隔抽幀」的刻板印象。它的核心判斷極度干脆:幀的價值,只取決于它是否包含關鍵動作與場景變化。
近日,該項「視頻關鍵幀選擇」研究成果已正式被人工智能頂級國際會議IJCAI 2026接收。

論文首頁信息
? 論文標題:LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning
? 論文鏈接:https://arxiv.org/abs/2601.14594
? 論文作者團隊:華為 GTS研發部 AI數據團隊

圖 1:LFS 訓練與推理整體框架

LFS并不笨重,它的選幀閉環僅靠三招,便實現了四兩撥千斤的奇效。
LFS首先使用凍結的Long-CLIP提取幀特征,隨后將其送入輕量級時間打分網絡TSNet。TSNet通過一維時間CNN精準捕捉局部的動作轉換,并結合全局門控調制,為每一幀生成專屬的「重要性分數」。高分幀,即代表著畫面正在發生關鍵動作或劇烈變化。
值得一提的是團隊在此處極具巧思的算法設計:面對超長視頻帶來的性能壓力,團隊摒棄了調用龐大視覺模型逐幀「重度審視」的傳統路線,而是另辟蹊徑,直接對其文本空間的特征向量進行高速評估。
這種「降維打擊」不僅讓幀選擇過程快如閃電,更將整個一維TSNet模型的參數量極限壓縮至僅126K。這一設計在推理速度與物理顯存占用上展現出了壓倒性的優勢,以極高的計算效率,完美實現了對海量視頻幀的「沙里淘金」。

圖 2:TSNet框架圖。
如果只挑最高分的幀,容易導致畫面全部扎堆在某一個激烈操作的時間段,LFS巧妙地將時間線劃分為多個片段,在每個片段內提取高分幀。這保證了模型既抓住了重點,又沒錯過視頻的完整生命周期。
LFS并沒有人為設定「哪幀重要」的代理指標,而是直接讓凍結Video-LLM 的Caption損失提供反饋。
訓練時,梯度只回傳到輕量的幀選擇器TSNet,視頻大模型本身始終保持凍結,從而將訓練和工程接入成本降至最低。
為了減少Caption生成的偏見并穩定優化過程,作者采用了一種相對Caption損失,即通過從同一采樣視頻幀集上計算的自回歸損失減去均勻采樣的自回歸損失:

其中
為計算的自回歸損失:


數據證明,學會「挑重點」確實能帶來更魯棒的理解力。
在真實業務基準上,搭載LFS的Qwen3-VL-8B整體準確率躍升至75%;在極其考驗關鍵動作捕捉的VDC Detailed子項中,準確率顯著提升至58%。
更硬核的是,LFS 展現出了極強的泛化能力。它生成的高質量Caption能夠直接反哺Zero-shot(零樣本)視頻問答,在MVBench、VideoMME等9個權威開源榜單上均取得穩定且全面的性能提升,除Dream-1K外均取得SOTA表現。

圖3:LFS在9個benchmark上相對基線取得穩定提升。

圖4:LFS在開源VDC benchmark上的效果提升。

長視頻理解的難點,從來不只是「視頻太長」,而是有效信息稀疏、關鍵瞬間易被淹沒。LFS的價值,正是讓模型在有限算力下優先看見真正改變業務語義的畫面。
這種「高性能、高命中」的特性,正精準契合行業垂域面向前沿領域的龐大多模態數據消費需求:
當AI應用從「能看見」走向「看得準、看得省、看得懂」,視頻數據的價值也不再取決于堆了多少幀,而取決于能否在正確的時刻抓住正確的信息。LFS提供 的,正是一條面向行業長視頻理解的高效技術路徑。
本專題其他文章