0
| 本文作者: Nemo | 2026-08-06 14:29 |
近日,第三屆中國計算機學會芯片大會(CCF Chip 2026)在太湖之濱無錫成功舉辦。
會場中,兩院院士與頂尖工程師們的討論話題直指底層架構(gòu)的“根技術(shù)”創(chuàng)新。一個核心追問被反復推至臺前:當摩爾定律逼近物理極限,制程紅利日益稀薄,堆核心、拼頻率的老路越走越窄,是否該徹底換一條路走?換言之,與其在通用架構(gòu)上不斷打補丁,能否從數(shù)據(jù)流動的本質(zhì)出發(fā),為特定場景原生設計一顆芯片?
作為全球首款RISC-V數(shù)據(jù)流架構(gòu)視頻智能AIGC芯片,金剛GC3芯片的出現(xiàn),不僅是一次產(chǎn)品首發(fā),更是為視頻而生的專用算力。
視頻洪流之下,通用芯片的搬運困局
當前,AI消耗的算力,大半都喂給了視頻。從Sora引領(lǐng)的文生視頻,到城市攝像頭每秒數(shù)千路的實時解析,再到工業(yè)產(chǎn)線上毫秒級的質(zhì)檢判定,視頻流不再是錦上添花的內(nèi)容載體,而是AI基礎設施的主航道。
然而,傳統(tǒng)CPU、GPU骨子里流淌的是控制流的血液。它們依賴程序計數(shù)器一步步推進指令,數(shù)據(jù)在內(nèi)存和計算單元之間來回搬磚。中科通量總工程師羅鑫算過一筆賬:在視頻處理中,數(shù)據(jù)搬運消耗的能量往往是實際計算的數(shù)倍,這種搬磚式算力,面對視頻流的海量、連續(xù)、高并發(fā)特性,就像用快遞三輪車去運洪峰期的集裝箱。
更棘手的是,視頻編解碼與AI推理深度耦合,需要細粒度并行和極低延遲,而通用架構(gòu)的緩存未命中、分支預測失敗等老毛病,在視頻場景下被成倍放大。當視頻AI從可選變?yōu)楸剡x,架構(gòu)層面的結(jié)構(gòu)性瓶頸,已不是堆更多晶體管能解決的。
數(shù)據(jù)流哲學:讓數(shù)據(jù)自己“跑”起來
在CCF芯片大會的“數(shù)據(jù)流計算分論壇”上,論壇主席、中科院計算所研究員葉笑春表示:“數(shù)據(jù)流架構(gòu)沒有程序計數(shù)器,只有‘數(shù)據(jù)就緒即執(zhí)行’。”
這聽起來像哲學,實則是工程范式的顛覆。傳統(tǒng)架構(gòu)是指令驅(qū)動:CPU問“下一條指令是什么?”;數(shù)據(jù)流架構(gòu)是數(shù)據(jù)驅(qū)動:哪個計算節(jié)點湊齊了所有輸入,它自己就立刻觸發(fā),結(jié)果直接傳給下游,無需折返全局內(nèi)存打卡報到。
這種模式天然契合視頻流:多路碼流好比多條獨立的數(shù)據(jù)河,每條河上的操作只依賴本地數(shù)據(jù),互不等待,并行度被徹底釋放;中間結(jié)果隨流水傳遞,訪存開銷大幅削減。現(xiàn)場有技術(shù)專家比喻說:“如果說GPU是萬人協(xié)同的大工廠,數(shù)據(jù)流芯片就是一條自動化的智能流水線——沒有空轉(zhuǎn),沒有堵車,每份數(shù)據(jù)到達即加工。”
當然,觀眾席上也有人拋出現(xiàn)實拷問:編譯器好不好寫?生態(tài)怎么建?大規(guī)模工程落地穩(wěn)不穩(wěn)?這些問題,恰好說明數(shù)據(jù)流已從理論探討進入實戰(zhàn)檢驗階段。
金剛GC3:不只是參數(shù),更是場景定制戰(zhàn)
展臺上的金剛GC3,給出了首份實戰(zhàn)答卷。羅鑫表示,金剛GC3基于RISC-V架構(gòu)的12核設計,主頻2.0GHz,單芯片INT8算力200 TOPS,F(xiàn)P16達32 TFLOPS,同時支持128路1080P@30fps硬解碼和64路硬編碼。上海交通大學教授冷靜文在現(xiàn)場評價:“在視頻AI推理上,它有和主流GPU掰手腕的峰值能力,而同等功耗下的視頻處理密度,是它的差異化殺手锏。”
值得注意的是其定位:不追求通吃所有AI負載,而是專注視頻場景。AIGC視頻生成、智慧城市分析、工業(yè)視覺感知。當大模型開始看長視頻、理解多模態(tài)時,面向視頻流優(yōu)化的專用芯片,不再是大而全的配角,而是精而專的主角。
這也折射出國產(chǎn)算力演進的一條新路徑:與其在通用賽道追趕巨頭,不如在場景深水區(qū)構(gòu)筑自己的護城河。從跟隨適配到場景定義,金剛GC3釋放的信號清晰而堅定:算力效率的最優(yōu)解,不是對通用架構(gòu)的修修補補,而是從數(shù)據(jù)流動的本質(zhì)出發(fā),為視頻量身再造一顆“芯”。