0

作者丨鄭佳美
編輯丨馬曉寧
剛剛,DeepSeek 更新了 DeepSeek-V4-Flash。
官方把它稱為“正式版”,不過目前只是在 API 端上線公測。此次更新也只涉及 deepseek-v4-flash,V4-Pro API,以及 App 和網頁端當前使用的模型,都沒有隨之更新。

但比起“正式版”這個名字,這次更新更值得關注的是另一句話:DeepSeek-V4-Flash-0731 與此前的 Preview 版本采用相同的模型結構和參數規模,只重新進行了后訓練。


01
大模型的訓練其實可以被簡單分成兩個階段。
第一個階段是預訓練。模型通過大量文本和代碼學習知識,形成基礎能力。這個階段決定了模型大致有多聰明、知道多少東西。
第二個階段是后訓練。它更像是針對具體工作進行專項訓練,讓模型學會怎樣回答問題、怎樣調用工具,以及怎樣按照要求完成任務。
這次 DeepSeek 沒有重新設計模型架構,也沒有擴大參數規模,而是在原有模型上重新進行后訓練。模型的結構沒有變化,但內部權重和行為方式會發生變化。
這有點像同一輛車沒有更換發動機,卻重新調整了變速箱、控制系統和駕駛策略。車本身沒有變大,但在特定道路上的表現可能明顯改善。
不過,DeepSeek 并沒有公布這次后訓練具體使用了哪些數據、獎勵方法和訓練流程。因此,目前只能確定它重新做了后訓練,不能進一步斷言性能提升究竟來自哪一種技術。

02
根據 DeepSeek 公布的結果,新版 V4-Flash 在 Terminal Bench 2.1 上獲得 82.7,在 DeepSWE 上獲得 54.4,在 DSBench-FullStack 上獲得 68.7。

這些測試和傳統的代碼補全不同。傳統代碼測試通常只要求模型寫出一段代碼,而 Agent 測試要求模型真正進入一個工作環境。它需要讀取文件、理解代碼倉庫、調用終端、修改程序、運行測試,再根據報錯繼續處理。
也就是說,模型不只是要知道答案,還要連續完成多個步驟。
不過,這些成績也不能完全理解成模型自身的單獨能力。DeepSeek 明確說明,部分代碼 Agent 測試使用了尚未公開的 DeepSeek Harness,并采用了較高的推理檔位;DSBench-FullStack 和 DSBench-Hard 還是 DeepSeek 自己的內部測試集。
因此,更準確的說法是:V4-Flash-0731 在 DeepSeek 公布的 Agent 運行環境中取得了明顯提升,但它在第三方框架中的實際表現,還需要更多獨立測試。

03
此次更新還有一個重要變化:V4-Flash 開始原生支持 Responses API,并針對 Codex 進行了適配。
Responses API 可以理解為一套更適合 Agent 的通信接口。它可以更統一地處理模型回復、推理狀態、工具調用和執行結果。

它本身不會讓模型突然變得更聰明,但可以減少模型接入 Codex 等 Agent 工具時的適配工作,讓開發者更容易把模型放進真實的軟件開發流程。雷峰網(公眾號:雷峰網)
所以,這次更新其實包含兩部分:一部分是重新后訓練后的模型權重,另一部分是更適合 Agent 使用的接口和運行環境。
最終成績由模型、推理預算、工具環境和 Agent 框架共同決定,很難只歸功于其中某一項。

04
目前可以確定的是,DeepSeek 在沒有改變 V4-Flash 模型結構和參數規模的情況下,通過重新后訓練提高了官方 Agent 基準成績,同時增強了對 Responses API 和 Codex 工作流的支持。
但現階段還不能直接得出后訓練已經可以替代模型擴容或者V4-Flash 已經全面領先其他 Agent 模型這樣的結論。
一方面,V4-Flash-0731 的具體后訓練變化尚未公開;另一方面,官方部分測試所使用的 Harness 和內部數據集還不具備完整的外部復現條件。
所以,這次更新不適合簡單總結為DeepSeek 又發布了一個更強的模型。更準確的理解是,DeepSeek 正在驗證一條更加務實的技術路線:當模型結構和參數規模保持不變時,能否通過重新后訓練、工具接口適配和 Agent 運行框架,進一步提高模型完成真實任務的能力。雷峰網
DeepSeek 已經給出了官方成績,但這條路線究竟能帶來多大的實際提升,還要等待更多訓練細節、公開工具和第三方測試。


上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。