0

作者丨幸麗娟
編輯丨齊鋮湧
IJCAI-ECAI 2026 將于 2026 年 8 月 15 日至 21 日在德國不來梅舉行。大會召開之際,AI科技評論也正在系統掃描本屆頂會收錄的論文,從中捕捉技術趨勢和行業風向。
在上一篇華為 IJCAI 2026 論文盤點:從「規模密度」轉向「設計密度」中,我們觀察到了大廠在參數競賽上的克制,以及對算力效率的追求。
而螞蟻集團入選的四篇論文,則指向了一條同樣重要但路徑截然不同的技術脈絡:對動態環境適應能力的系統性探索。
算法模型的精度在實驗室里不斷刷新紀錄,但一旦部署到真實世界,性能衰減幾乎成為常態。原因很簡單:真實世界從來不是靜止的。
螞蟻集團的業務場景,將這種“不靜止”推向了極致:超10億用戶、8000多種服務,支付洪峰與凌晨低谷之間可以差出幾個數量級,風控模型必須以小時級響應黑產策略的迭代,全球化部署還要適配各國迥異的金融基礎設施。
在這樣的環境里,“一次訓練、永久部署”的靜態模型,注定陷入“刻舟求劍”的困境。
也正因此,真正的智能,在于算法能否感知環境變化、主動調整自身策略、在動態中尋找最優解。螞蟻集團這四篇論文,不約而同地回答了這個核心命題:如何讓AI從“靜態的求解器”進化為“動態的自適應者”?

01
時間序列聚類,就是把海量行為序列自動歸類,這是一種理解行為模式、監控異常信號的基礎工具。
但現有方法各有各的尷尬:
相似度方法(如k-Shape):能抓局部模式,但要算所有樣本兩兩之間的距離,數據一多就跑不動了;
深度學習方法(如自編碼器):表征能力強,但訓練貴、調參煩、算力消耗大;
傳統特征提取:依賴人工設計特征,關鍵的時間動態信息可能被丟掉。
更大的問題是:現實中的時序數據密度分布極不均勻——雙十一交易數據密集如暴雨,凌晨數據則稀疏如滴水,但傳統方法需要你提前告訴它分成幾類,這本身就與現實錯位。
螞蟻集團聯合重慶郵電大學提出的 MSRGC-Net,用一套“無訓練”的組合拳,繞開了精準度和計算效率之間的兩難選擇。

論文地址:https://arxiv.org/pdf/2606.12077v1
▎它的核心邏輯可以拆成三步:

第一步,多尺度儲備池編碼(特征提取)。使用多個無需訓練的回聲狀態網絡(ESN)作為儲備池計算的基本單元,僅靠調整譜半徑就能從原始時序中同時提取局部波動和長期趨勢,將所有樣本聚合后形成視圖特征矩陣 ,作為后續環節的輸入。
第二步,“顆粒球”錨定圖構建(結構建模),這是最巧妙的部分。算法不再盯著單個數據點,而是根據數據的局部密度自動劃分“顆粒球”(Granular Ball):密度高的區域形成小而多的顆粒,密度低的區域形成大而少的顆粒。數據規模從 N 壓縮到 M(顆粒數,M < N),同時噪聲干擾也被抑制。
第三步,基于共識的多尺度圖優化。跨尺度的錨定圖通過共識策略融合,使模型既能捕獲微觀局部模式,又能把握宏觀全局趨勢,最終生成無需人工指定聚類數目的魯棒聚類結果。
這套打法效果如何?

在5個多變量基準數據集、15項評估指標(NMI、ARI、RI各5項)上,MSRGC-Net拿了12項最優、2項第二——80%的最優率。
更關鍵的是,它避開了O(n2)的成對計算,實現了近線性的復雜度。簡單說就是:又快又準,而且不需要你猜要分幾類。
在螞蟻的實際業務場景中,這意味著系統能根據流量密度自動調整聚類粒度——高峰時精細分群抓異常,低谷時粗粒度概括省算力,始終跟著數據走。

02
強化學習有個著名的“水土不服”問題——“分布偏移”:在離線數據上訓練好的模型,一上線就容易“失憶”。這是因為離線數據和在線交互數據之間存在分布差異,導致在線初期策略迅速“遺忘”離線學到的知識。
現有的解決辦法無非兩種:要么固定50%離線+50%在線這樣的混合比例,要么用啟發式規則優先采樣“近策略”的樣本。
但問題是,策略在不同階段的需求完全不一樣——早期需要更多離線數據穩住基本盤,后期需要更多在線數據探索新可能。固定策略,就是刻舟求劍。
螞蟻集團聯合上海交通大學提出ROAD ,把數據混合比例從一個“預設參數”變成了“動態決策變量”。

論文地址:https://arxiv.org/pdf/2605.14497
它的核心思想很有意思:數據選擇本質上是個雙層優化問題。

內層(Inner-Level):標準的Q學習更新,即最小化貝爾曼誤差;
外層(Outer-Level):將數據混合策略視為元決策變量,以最大化在線策略的預期回報為目標。
兩層通過多臂老虎機 MAB (Multi-Armed Bandit)算法近似求解,使得混合策略能夠在訓練過程中實時調整:一旦發現模型開始“遺忘”離線階段學到的知識,就自動調高離線數據的采樣比例來穩住基本盤;當模型趨于保守、探索不足時,又及時增加在線數據的占比,鼓勵它去試錯。
實驗做得挺扎實。團隊在離線到在線強化學習的三大經典基準上進行了驗證:AntMaze(機器人在迷宮中尋找目標)、MuJoCo(仿生機器人的運動控制)和FrankaKitchen(機械臂在廚房中完成復雜操作)。這些任務難度不同、狀態空間各異,能比較全面地檢驗算法的泛化能力。

為驗證ROAD的算法普適性,研究團隊ROAD和IQL、PEX、CQL、Cal-QL等多種主流離線算法“嫁接”在一起。結果顯示:無論底層用哪種算法,ROAD都能穩定帶來性能提升。

以PEX+ROAD為例,該方法在D4RL基準的24個連續控制任務上取得了71.12的總體平均分,24個任務里有18個排第一,顯著優于固定比例、遞減比例、啟發式平衡回放等所有基線。
也就是說,ROAD 能夠讓模型在“保守繼承”和“激進探索”之間找到了最優平衡點——既不會一上線就翻車,也不會錯失實時數據帶來的提升機會。該方法對螞蟻集團風控模型上線、推薦系統實時優化這類場景而言,價值很鮮明。

03
貝葉斯優化是黑盒函數優化的經典方法,但一碰到高維問題就頭疼。一種常見解法是隨機嵌入——把優化投射到低維子空間,但新問題來了:有效維度到底是多少?
傳統方法要么依賴專家經驗給定固定子空間維度,要么通過試錯法反復估計,不僅消耗大量資源,且固定的子空間維度難以適配不同任務。更麻煩的是,有效維度本身可能隨優化進程變化:初期探索時低維度就夠用,后期精調時可能需要更高維度的細節。
螞蟻集團聯合華東師范大學、南京大學提出的 DSEBO,讓子空間維度成為優化進程中的“動態變量”,隨搜索進度自主切換。

論文地址:https://arxiv.org/pdf/2605.23473
DSEBO的核心機制是“從低到高,逐級躍升”:

從低維子空間出發,優化器在低維空間生成候選解,經隨機嵌入映射至原始空間,并快速摸清目標函數的大致輪廓,然后結果反饋驅動高斯過程迭代更新;
觀察到收斂后自動觸發維度擴展,通過共享嵌入矩陣把低維解“繼承”到高維;
新子空間初始化和繼續優化,由共享嵌入矩陣確保各子空間相互嵌套,形成“低維探索→收斂觸發→維度擴展→繼續優化”的循環,直到達到評估預算上限。
其中維度擴展環節,擴展幅度也不是固定的——算法會根據當前最優值變化曲線自適應調整:曲線平緩就慢點擴,省不必要的開銷;曲線陡峭就快點擴,快速捕捉高維增益。
實驗結果是:在合成函數(Levy、Griewank、Sphere,D=1000)和三個真實任務(MSLR、Lasso-Hard、LIMO)上,DSEBO與REMBO、SIRBO、BAxUS、TuRBO等十幾種主流方法逐一對比,幾乎所有任務上都拿下了最優解——精度和收斂速度雙雙領先。

這套“低維探路、高維精調”的打法,在螞蟻的日常研發中也很實用——信貸模型的超參數調優、風控策略的閾值尋優、營銷活動的多變量實驗設計,不再需要專家拍腦袋估計維度了,算法自己會“邊走邊看”,實現了自動化、高效率的運行。

04
如果說前三篇論文討論的是算法層面的自適應,那么VGA-BenchV2展示的是評估基礎設施如何“自適應”AIGC 技術生態的迭代。這也是四篇論文中唯一聚焦多模態內容理解的工作,映射了螞蟻集團在數字生活、內容生態等非金融領域的戰略儲備。
AIGC讓視頻生產大爆發,但一個核心問題卡住了:我們怎么系統性評估這些生成視頻的質量?
傳統評估指標如 FVD(評估整體質量與時序連貫性)CLIP Score(評估生成圖像與文字描述的語義一致性),主要看畫面清不清晰、動作連不連貫、文本對不對得上。至于構圖精不精妙、光影講不講究、色彩和不和諧——這些關乎“美感”的感知品質,它們幾乎無能為力。
此前CVPR 2026上,螞蟻聯合北京電影學院、通用人工智能研究院(BIGAI)提出了VGA-Bench,首次為視頻審美評估建立了三維度框架(美學質量、美學標簽、生成質量),并基于1016個提示詞、12個生成模型、超6萬個視頻構建了評估基準,讓AI第一次學會了從專業視角“鑒賞”視頻。

論文鏈接:https://arxiv.org/pdf/2604.10127
但視頻生成模型進化太快,以月為單位的迭代節奏讓固定基準很快就“不夠用了”。在這篇IJCAI 2026論文中,團隊又進一步推出VGA-BenchV2。

開源地址:
https://huggingface.co/datasets/BestVictoryLab/VGA-Bench
▎核心進化有三點:
第一,人工標注量級增加。 VGA-BenchV2新增了36,000條任務級人工標注,其中美學質量標注16,200條、美學標簽標注13,200條、生成質量標注6,600條,相比VGA-Bench分別實現了13.46倍、11.15倍和1.55倍的擴展。更充足的“人類偏好”數據,讓評估器與人的審美判斷對齊得更準。
第二,評估器架構升級。團隊設計了混合架構:VAQA-Net負責連續美學評分,VTag-Net和VGQA-Net基于Qwen大視覺語言模型進行標簽識別和質量評估。大模型的引入,讓評估器對復雜視覺語義的理解上了一個臺階。實驗結果表明,其在多個生成模型上的評估結果與人類判斷高度一致。
第三,從“評估”到“優化”的閉環打通。 這是VGA-BenchV2最具突破性的設計:它將學到的美學評估器作為獎勵信號,直接用于強化學習的生成模型微調。這意味著評估基準不再只是“裁判員”,它給出的分數可以直接轉化為優化信號,指導生成模型在美學質量上持續迭代。
VGA-Bench到VGA-BenchV2,評估體系不再是靜態的標尺,而是與生成生態“共進化”的活系統。對于螞蟻集團的內容理解、安全審核、推薦優化等場景而言,視頻質量評估能力不僅能跟上AIGC生態的演進,還能反過來驅動上游模型的優化:從“打分”到“優化”,閉環就此形成。

05
四篇論文分別從無監督學習、強化學習、黑盒優化和多模態評估四個方向切入,共同指向了同一個技術路徑——從靜態到動態的范式轉換。
實驗數據也印證了這條路徑的有效性:MSRGC-Net在15項指標中拿下12個第一、2個第二;ROAD在多類離線到在線強化學習任務中超越現有策略;DSEBO在千維優化問題上實現了可量化的改進;VGA-BenchV2在多個生成模型上的評估結果與人類判斷高度一致。
順著這條技術路徑再看螞蟻的整體布局,會發現一個清晰的“雙輪驅動”結構:一面在金融核心場景中深耕時序建模、強化學習和優化算法;一面在數字生活與內容生態中前瞻布局多模態理解與評估基礎設施。
說到底,算法再聰明,終歸要回到動態的環境中檢驗。這四篇論文的真正價值,或許正在于它們都生長在真實的業務土壤里:螞蟻的業務場景不是論文的“背景板”,而是問題的來源、數據的產地和效果的檢驗場。
而這或許,正是工業界做 AI 研究最獨特的地方——他們不只是在“做論文”,更是在為真實世界的問題,找“能抗住動態變化”的解法。 雷峰網雷峰網雷峰網(公眾號:雷峰網)
IJCAI 2026 要來了,你還在單打獨斗?
為了方便大家抱團交流、互通會議消息,我們專門建了 IJCAI 2026 參會群!進群你會解鎖這些「福利」?
會議情報站:投稿 DDL、格式規范、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。
同行茶話會:天南海北的同行都在群里,聊心得、碰思路、攢人脈,科研路上我們同行。
前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。
現場后援團:(會議期間專屬開啟):到了會場也不用慌——
路線導航:場館分布、報告廳怎么走,群里隨時問;
議題共讀:熱門 session、Keynote 現場探討,錯過也能追;
Poster 匯編:現場海報精華整理,一鍵收藏不遺漏;
約局廣場:約飯局、采訪局、交流局……想嘮嗑、想合作、想面基,群里發起就成。
? 進群傳送門: 掃碼進群或添加微信Qvv0909777,備注:IJCAI + 單位/學校+姓名+方向。

搞科研/搞技術,信息差很重要。
來,一起快人一步!


上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。