0
| 本文作者: 陳淑瑜 | 2026-06-26 10:53 | 專題:ICML:國際機器學習會議 |
來源:公眾號“藍戒AI知行”
原文鏈接:https://mp.weixin.qq.com/s/KUMrshWq4KqXh7dagZ6kUg
用過大模型的朋友都知道,LLM生成文本簡直就像老太太繡花——一字一字往外蹦。這種“自回歸”機制(Autoregressive)是大模型天生的阿喀琉斯之踵:每一個Token的誕生,都要大模型把幾百億參數的腦子全量轉一圈,顯存帶寬直接被榨干,GPU利用率低得讓人流淚。
為了解決這個痛點,業界發明了“投機采樣”(Speculative Decoding)。簡單來說,就是找個“小弟”(輕量級草稿模型)在前面瘋狂盲猜,猜出一串Token后,再讓“大哥”(目標大模型)并行為其驗證。如果小弟猜對了,大哥就一拍大腿全部放行,速度自然就提上來了。
聽上去很美對不對?但現實很骨感。目前最頂級的投機采樣方案(比如EAGLE-3),它里面的“小弟”依然是用自回歸方式一個字一個字去猜的!這意味著什么?小弟自己也是個慢性子,它在前面帶路慢吞吞,大哥在后面等得干著急。這種套娃式的自回歸,讓整體的加速比死死卡在了2到3倍的瓶頸上,再難寸進。
既然一個字一個字猜太慢,那能不能直接“畫”出一張圖那樣,直接吐出一整塊(Block)Token?
Z Lab 團隊(來自UCSD的Jian Chen, Yesheng Liang, Zhijian Liu等學者)在 ICML 2026 上發表的最新重磅成果——DFlash(官方倉庫:z-lab/dflash),直接打破了這個僵局。DFlash 的核心思想讓人直呼過癮:既然自回歸依賴太重,那我們干脆掀翻桌子,用輕量級塊擴散模型(Block Diffusion Model)來當這個帶路的小弟!
擴散模型大家熟悉吧?Midjourney和Stable Diffusion生成圖片時,都是從一堆噪聲開始,一秒鐘“刷”地一下直接去噪生成整張圖。DFlash 把這個邏輯玩到了文本生成上。它讓小弟在單次前向傳播中(Single Forward Pass),利用雙向注意力機制,直接把后面8到16個Token的空位全部填滿!
當別的方案還在像小學生一樣“一、二、三、四”數數時,DFlash 已經一巴掌把一整個句子的草稿拍在桌上了。計算成本直接暴跌,效率直接拉滿!
有人可能會問:“擴散模型生成文本的質量,之前不是被自回歸吊打嗎?它猜的草稿大哥能看上眼?”
這就是 DFlash 絕妙的“借力打力”之處。Z Lab 團隊沒有讓這個輕量級擴散模型去閉門造車,而是做了一個極度聰明的設定——上下文特征注入(Context Conditioning)。
在 DFlash 運行期間,它會直接從大哥(目標大模型)的5到6個隱藏層中提取深層特征,融合成一個上下文向量注入到小弟的腦子里。這就好比小弟在前面考試,大哥坐在后面不斷用傳音入密的方式偷偷遞“小抄”,把最頂級的推理邏輯和語境直接共享。
有了大哥的深度降維打擊,DFlash 這個小弟寫出的草稿不僅速度奇快,而且接受率高得驚人。大哥在后面并行驗證時,一看“哎喲,全對!”,直接一路綠燈。
數據從來不會說謊。官方測試數據顯示,DFlash 在主流的 Qwen3-8B 等模型上,直接實現了高達 6.17倍的無損加速(Lossless Acceleration)!跟目前最前沿的 EAGLE-3 相比,它的速度還要快上將近 2.5倍。
更硬核的是,DFlash 絕對不是實驗室里自嗨的PPT,它的工程落地速度快到讓人發指。目前:
vLLM
SGLang
MLX
Google TPU
這意味著,無論你是云端大廠,還是Mac白領,立刻就能白嫖到這波高達6倍的速度紅利。
最后聊聊藍戒自己的看法。前兩年整個AI圈都在死磕“擴散模型到底能不能取代自回歸做大語言模型”,各種嘗試基本都撞了南墻,因為擴散模型在長文本的嚴密邏輯上天生就比較弱。
而 DFlash 的出現,給所有研究擴散模型的人上了一課:方向錯了,馬力再大也沒用。擴散模型根本不需要在生成質量上和自回歸LLM死磕,它最完美的生態位,其實是當一個極致的“金牌打字員”!
把擴散模型禁錮在“草稿階段”,用并行的速度優勢去彌補自回歸的延遲,再用自回歸大模型去兜底質量。這種“擴散模型負責速度,自回歸模型負責靈魂”的夢幻聯動,不僅完成了對傳統推測解碼的降維打擊,也為未來的大模型端側落地和實時交互指明了真正的康莊大道。
還在抱怨你的本地大模型卡得像PPT?趕緊去 GitHub 搜一把 z-lab/dflash,體驗一下什么叫真正的飛速狂飆吧!
官方倉庫:https://github.com/z-lab/dflash