0
| 本文作者: 高允毅 | 2026-07-31 10:38 |

作者丨高允毅 樊天驕
編輯丨馬曉寧
7 月 27 日,月之暗面拿出全部誠意,直接把滿血版 2.8T 模型 Kimi K3 全部開源了。在技術(shù)報告的最后,他們首次公布了Kimi K3背后的實(shí)際貢獻(xiàn)者名單,我們細(xì)數(shù)了一下,有401位成員,可以說,這是月之暗面人才團(tuán)隊(duì)的一次全面亮相。


從當(dāng)初那個估值僅幾億美金的初創(chuàng)團(tuán)隊(duì),到如今名副其實(shí)的“國產(chǎn)大模型之光”,月之暗面已然成為全球牌桌上,少數(shù)能與 Claude Fable 5 和 GPT-5.6 Sol 這樣頂尖模型“掰手腕”的極客團(tuán)隊(duì)。
伴隨 K3 的發(fā)布,月之暗面最新估值飆升至 315 億美元,約為 2100 億元人民幣,而撐起這 2100 億估值的,是一個極度年輕的團(tuán)隊(duì)。
據(jù)公開信息顯示,月之暗面大概有 300 多人,平均年齡不到30歲,其中,80% 是 I 人。如果換算一下,基本人均扛起7億人民幣的估值。
月之暗面的組織形式十分扁平。月之暗面一共有五個創(chuàng)始人,平均每人直接對接 40-50 人。內(nèi)部以“無職級、無KPI、無部門墻”著稱,員工隨時可以挑戰(zhàn)老板。有一個細(xì)節(jié)是,在2025年初反思會,有員工提激進(jìn)建議,楊植麟聽完后做得比建議更激進(jìn),直接放棄 K1 轉(zhuǎn)做 K2。
這種不拘一格同樣體現(xiàn)在公司的“靈魂”里。作為搖滾愛好者的楊植麟,將會議室冠以 Rolling Stones、Nirvana、Radiohead 等傳奇樂隊(duì)之名,甚至連 Kimi 的會員套餐都以 Adagio(柔板)、Allegro(快板)等音樂術(shù)語來命名。
月之暗面堅信,在算力和數(shù)據(jù)日益同質(zhì)化的今天,“品味”才是建立差異化壁壘的核心驅(qū)動力。這種品味不僅體現(xiàn)在模型打磨上,更深刻地映射在他們對人才的挑剔與渴望上。
月之暗面喜歡雇傭 CEO 們,非常青睞有“創(chuàng)業(yè)者光環(huán)”或“賭徒基因”的人。據(jù)公開資料顯示,公司內(nèi)部至少有 50 人創(chuàng)辦或加入過創(chuàng)業(yè)公司。而在過去一年,月之暗面招聘的新人中有超過 100 個是通過內(nèi)部推薦進(jìn)來的。
今天,我們按照名單,全面深挖,將 K3貢獻(xiàn)者有關(guān)的一切公開可信信息匯總于此。這支頂尖極客軍團(tuán)的核心背景與硬核實(shí)力,盡數(shù)展現(xiàn)。

01
▎周昕宇:

周昕宇是月之暗面的核心聯(lián)合創(chuàng)始人之一,同時他也是算法團(tuán)隊(duì)負(fù)責(zé)人。
周昕宇與楊植麟早就相識,很有趣的一個細(xì)節(jié)是,周昕宇曾是清華大學(xué) Splay 樂隊(duì)吉他手,而鼓手正是楊植麟。
在加入月之暗面之前,周昕宇曾在曠視從事算法量產(chǎn)及移動端模型研究。他與當(dāng)時曠視的基礎(chǔ)科研負(fù)責(zé)人、現(xiàn)任階躍星辰的首席科學(xué)家張祥雨緊密合作,作為核心作者親手寫出了輕量化網(wǎng)絡(luò)大作 ShuffleNet。
周昕宇的主攻方向是大模型算法量產(chǎn)化,擅長將最前沿的實(shí)驗(yàn)室算法,高效率、低成本地轉(zhuǎn)化為大規(guī)模生產(chǎn)線系統(tǒng)。他還擅長混合架構(gòu)優(yōu)化,在 Reddit 社區(qū)的技術(shù)交流(AMA)中,率先拆解了 Kimi K3 KDA 混合架構(gòu)結(jié)合 NoPE MLA 的對比優(yōu)勢,證實(shí)該架構(gòu)在預(yù)訓(xùn)練和強(qiáng)化學(xué)習(xí)中更省算力、速度更快。
▎吳育昕:

吳育昕是月之暗面的聯(lián)合創(chuàng)始人之一。同時,他還是人工智能領(lǐng)域的頂尖專家與明星架構(gòu)師,在深度學(xué)習(xí)、計算機(jī)視覺(CV)以及大語言模型(LLM)的底層工程架構(gòu)與基礎(chǔ)設(shè)施上擁有極深造詣 。
吳育昕與楊植麟擁有相同的教育背景,本科畢業(yè)于清華大學(xué)計算機(jī)系,隨后赴美國卡內(nèi)基梅隆大學(xué)(CMU)深造 。他曾在 Meta AI 研究實(shí)驗(yàn)室(FAIR)擔(dān)任研究工程師,期間主導(dǎo)并貢獻(xiàn)了多項(xiàng)計算機(jī)視覺里程碑級技術(shù)。
在與楊植麟創(chuàng)立月之暗面之前,吳育昕就已經(jīng)在深度學(xué)習(xí)和計算機(jī)視覺領(lǐng)域留下了兩個行業(yè)標(biāo)準(zhǔn)級的重磅成果:
一個是作為 Detectron2 的主要創(chuàng)建者和開發(fā)者之一,這個項(xiàng)目直接重塑了全球計算機(jī)視覺的研究生態(tài),成為全球成千上萬視覺大模型和目標(biāo)檢測項(xiàng)目的“通用底座” 。
更具開創(chuàng)性的是,他在 2018 年與頂尖學(xué)者何愷明共同發(fā)表了關(guān)于 Group Normalization 的大作,獲得 ECCV 2018 最佳論文榮譽(yù)提名(Best Paper Honorable Mention)。
這篇經(jīng)典直接打破了傳統(tǒng) Batch Normalization 在小樣本訓(xùn)練下的致命瓶頸。這種用一兩行底層創(chuàng)新就“重寫全球 AI 訓(xùn)練規(guī)則”的能力,讓吳育昕在開源世界擁有極高的技術(shù)號召力。
在月之暗面,他是那個打地基的人。他深度參與大模型架構(gòu)與訓(xùn)練效率的優(yōu)化工作,更曾親臨全球 PyTorch 開發(fā)者大會,向全世界硬核拆解 Kimi 對全球開源基建的底層貢獻(xiàn) 。
吳育昕的專攻方向,完美補(bǔ)齊了 Kimi 沖擊下一代多模態(tài)長文本極限的最后一塊拼圖。他擅長高性能深度學(xué)習(xí)系統(tǒng)優(yōu)化,解決的是如何讓大模型在萬億參數(shù)下跑得更穩(wěn)、算得更快、內(nèi)存吃得更少,這正是 Kimi 在長文本和高并發(fā)下保持絲滑體驗(yàn)的技術(shù)鐵壁 。
作為深度學(xué)習(xí)里程碑之作 MoCo v1 的核心作者之一 ,他讓 Kimi 不僅擁有行業(yè)最強(qiáng)的大腦(自然語言理解),更正在長出能夠深度理解現(xiàn)實(shí)物理世界的眼睛(多模態(tài)視覺)。
▎張宇韜:

張宇韜是月之暗面的聯(lián)合創(chuàng)始人之一,同時也是月之暗面的 CTO。他與楊植麟為清華同門師兄弟,智譜創(chuàng)始人唐杰是他的老師。
2016 年,張宇韜與楊植麟共同創(chuàng)立“循環(huán)智能”,隨后,他與楊植麟共同創(chuàng)立“月之暗面”。如果說楊植麟是月之暗面的“領(lǐng)航員”,那么張宇韜就是那個負(fù)責(zé)把“智能”這艘巨輪動力系統(tǒng)調(diào)校到極致的首席工程師。 Kimi 能夠在長文本、復(fù)雜推理和 Agent 任務(wù)執(zhí)行上實(shí)現(xiàn)跨越式進(jìn)化,張宇韜功不可沒。
在加入月之暗面之前,他已經(jīng)在知識圖譜與異構(gòu)數(shù)據(jù)融合領(lǐng)域留下了數(shù)個“行業(yè)級”的重磅成果。
他最廣為人知的技術(shù)標(biāo)簽之一,是作為技術(shù)負(fù)責(zé)人主導(dǎo)了科技大數(shù)據(jù)分析平臺 AMiner 的研發(fā)。這個如今服務(wù)于全球千萬級學(xué)者的平臺,其背后核心的異構(gòu)數(shù)據(jù)融合技術(shù)就包含張宇韜在清華攻讀博士期間參與構(gòu)建的底層能力。這種對 “海量知識如何被機(jī)器吸收、理解并檢索” 的深度洞察,直接構(gòu)成了 Kimi 超長文本處理能力的技術(shù)底座。
在學(xué)術(shù)貢獻(xiàn)上,他在 KDD、CIKM 等計算機(jī)頂尖會議發(fā)表過多篇高引論文。他不僅擅長通過知識圖譜讓 AI 具備“邏輯感”,更是在循環(huán)智能時期就主導(dǎo)開發(fā)了“千循零樣本 AI 平臺”,實(shí)現(xiàn)了行業(yè)大模型在企業(yè)服務(wù)場景的規(guī)模化落地。
張宇韜的專攻方向,精準(zhǔn)預(yù)判了 AI 從“能對話”向“能干活”轉(zhuǎn)變的每一個節(jié)點(diǎn)。 他專注于推動長上下文窗口技術(shù)和動態(tài)擴(kuò)展網(wǎng)絡(luò)架構(gòu),解決的是如何讓 AI 在海量信息中保持“清醒”。
在 2026 年 7 月的最新技術(shù)峰會上,他一針見血地梳理了行業(yè)工程化的三段技術(shù)脈絡(luò):2023 年是研究‘怎么問’的 Prompt 時代,2024 年演進(jìn)到‘給足信息’的 Context 時代,而到了 2026 年,大模型正式步入 Harness 工程新階段 。 如今,他正帶領(lǐng)團(tuán)隊(duì)攻克“怎么構(gòu)建運(yùn)行環(huán)境、讓 AI 出了問題能自己閉環(huán)修改”的 Agent 終極戰(zhàn)局。
▎許欣然:

圖注:右一是許欣然
許欣然是月之暗面(Moonshot AI)工程副總裁兼 AI 基礎(chǔ)設(shè)施負(fù)責(zé)人。
他具備全棧底層開發(fā)經(jīng)驗(yàn),此前在曠視曾負(fù)責(zé) MegEngine(天元)深度學(xué)習(xí)框架與億級向量檢索系統(tǒng)的研發(fā)。目前,他主要負(fù)責(zé)月之暗面大模型訓(xùn)練、推理與基礎(chǔ)設(shè)施的整體架構(gòu)設(shè)計。
在大模型推理端,針對 Kimi 的長文本業(yè)務(wù)場景,他與團(tuán)隊(duì)聯(lián)合設(shè)計了以 KV Cache 為中心的分離式推理架構(gòu) Mooncake。該成果因徹底分離了預(yù)填充(Prefill)與解碼(Decode)階段、緩解了百萬級超長上下文的顯存和 I/O 壓力,獲得了存儲頂級會議 FAST 2025 最佳論文獎。
同時,作為 MoBA(混合塊注意力)機(jī)制的核心作者之一,他通過塊級別注意力切分,在訓(xùn)練和推理兩端為 Kimi 實(shí)現(xiàn)了大幅的降本增效。
在模型訓(xùn)練端,他參與了開源項(xiàng)目 Moonlight 及其底層優(yōu)化器 Muon 的研發(fā),利用矩陣正交化處理替代傳統(tǒng) AdamW,降低了萬億參數(shù)模型在分布式訓(xùn)練中的算力成本。
憑借這一系列在大規(guī)模長文本流量下的分布式存儲與推理實(shí)踐,他曾受邀在 GOSIM China 全球開源盛會上發(fā)表演講。他的專攻方向始終聚焦于全棧大模型架構(gòu),致力于用更少的 FLOPs 損耗和 KV Cache 占用,支撐高智能的長文本推理。
▎何蔚然:

作為月之暗面推理系統(tǒng)負(fù)責(zé)人,他是存儲頂會 FAST 2025 最佳論文的核心作者,是 Kimi 長文本推理架構(gòu)工程落地的核心技術(shù)骨干。從 Kimi k1.5、Kimi-VL、K2 到 Kimi Linear、Kimi-Audio,再到 MoBA、Muon、AttnRes 等核心架構(gòu)論文,其署名貫穿六代技術(shù)成果,所有工作始終圍繞同一個核心:用系統(tǒng)設(shè)計換效率,讓大模型真正用得起。
加入月之暗面之前,何蔚然已經(jīng)在高效計算領(lǐng)域深耕多年。他畢業(yè)于清華大學(xué)計算機(jī)系,早年深耕芯片布線與底層性能優(yōu)化;曠視時期他主力攻堅自研 AI 芯片與低位寬神經(jīng)網(wǎng)絡(luò),與后來的月之暗面聯(lián)合創(chuàng)始人周昕宇同期共事 —— 周昕宇正是經(jīng)典 OCR 文字檢測方案 EAST 的第一發(fā)明人。
2023年加入月之暗面后,他把多年的系統(tǒng)工程經(jīng)驗(yàn),全部落地到了萬億參數(shù)大模型的推理服務(wù)上。
他最具代表性的成果,是 KVCache 分離式推理架構(gòu) Mooncake。這套系統(tǒng)打破了傳統(tǒng)推理服務(wù)的架構(gòu)定式,把大模型最耗顯存的記憶緩存拆解出來集中調(diào)度,通過全局緩存復(fù)用和精細(xì)化路由,在算力規(guī)模不變的前提下,讓 Kimi 的請求承載量提升超 75%。他在 2024 年 QCon 大會上披露,依托這套架構(gòu)和持續(xù)的工程優(yōu)化,Kimi 推理集群的單位成本一年下降超 20 倍。
2025年2月,Mooncake 相關(guān)論文拿下 FAST 大會埃里克·里德爾最佳論文獎——這是存儲系統(tǒng)領(lǐng)域的最高榮譽(yù)之一。更能體現(xiàn)其工程價值的是,早在論文正式獲獎前,這套架構(gòu)已經(jīng)在 Kimi 生產(chǎn)環(huán)境數(shù)千個節(jié)點(diǎn)上穩(wěn)定運(yùn)行,每天處理上千億 token 的用戶請求。
盡管 K3 技術(shù)報告未披露具體個人分工,但多項(xiàng)核心突破都延續(xù)著他團(tuán)隊(duì)的技術(shù)脈絡(luò):針對 KDA+MLA 混合架構(gòu)下傳統(tǒng)前綴緩存失效的難題,團(tuán)隊(duì)向 vLLM 社區(qū)貢獻(xiàn)了官方適配實(shí)現(xiàn);
面向百萬 token 長請求,集群采用緩存感知的路由調(diào)度策略,最大化緩存復(fù)用效率。最終 K3 交出的成績是推理成本僅為 Claude Fable 5 的 38%,而 KVCache 優(yōu)化、前綴緩存、成本控制,恰恰都是 Mooncake 體系的核心命題。
從芯片布線到萬億大模型推理,何蔚然的技術(shù)路徑始終清晰:死磕系統(tǒng)效率,用工程設(shè)計換更低的計算成本。如果說頂尖算法研究員為 Kimi 拉高了能力上限,他和團(tuán)隊(duì)做的,就是把這份旗艦級的能力落到實(shí)處,讓更多普通用戶能用得起、用得穩(wěn)。

02
▎杜羽倫:

杜羽倫在月之暗面負(fù)責(zé)預(yù)訓(xùn)練(Pretraining)與規(guī)模化(Scaling)方向。
他畢業(yè)于美國伊利伊諾大學(xué)香檳分校和卡內(nèi)基梅隆大學(xué)人工智能專業(yè)。隨后加入循環(huán)智能,歷任研究員、AI Lab 負(fù)責(zé)人,是月之暗面的核心技術(shù)元老。
作為模型基座預(yù)訓(xùn)練與規(guī)模化方向的核心負(fù)責(zé)人,他的技術(shù)貢獻(xiàn)完整貫穿了Kimi歷代核心旗艦基座,以及VL、Audio等多模態(tài)全系列的架構(gòu)設(shè)計。
在底層技術(shù)突破中,他是《Attention Residuals》、《MoBA(混合塊注意力)》以及預(yù)訓(xùn)練優(yōu)化器論文《Muon is Scalable for LLM Training》的共同作者。其工作核心在于:通過塊級別注意力切分與訓(xùn)練流重構(gòu),緩解超深網(wǎng)絡(luò)中的信號衰減問題,顯著提升萬億大模型的分布式訓(xùn)練效率。
在工程開源層面,他是 MoonshotAI 官方開源項(xiàng)目的活躍核心貢獻(xiàn)者。從代碼協(xié)作記錄來看,杜羽倫與算法專家蘇劍林、推理系統(tǒng)負(fù)責(zé)人何蔚然之間有著高頻的協(xié)同開發(fā)與代碼審查配合,三者共同構(gòu)成了 Kimi 支撐百萬級長文本和全模態(tài)高效流轉(zhuǎn)的底層技術(shù)閉環(huán)。
▎張宇:
張宇是月之暗面的核心架構(gòu)師,主攻大語言模型的高效、可擴(kuò)展和硬件友好型架構(gòu)設(shè)計。作為非 Transformer與線性注意力路線開拓者,他致力于攻克長文本“越長越慢、極度燒錢”的工程魔咒。
在學(xué)術(shù)與工程實(shí)踐上,張宇成果頗豐。他不僅是殘差連接《Attention Residuals》論文共同第一作者,更是月之暗面高效模型架構(gòu)的核心研發(fā)一作。
由他主導(dǎo)開源的 Kimi Linear 模型,首次將線性注意力機(jī)制成功應(yīng)用于超長上下文任務(wù),實(shí)現(xiàn)了顛覆性的效率躍升。不僅如此,他在知乎等技術(shù)社區(qū)分享的 “Kimi Linear 研發(fā)心路”,至今仍被無數(shù)大模型數(shù)據(jù)工程師奉為必讀指南。
從實(shí)現(xiàn) 7B 模型的底層破局,到一戰(zhàn)助力萬億參數(shù)大模型沖入全球第一陣營,張宇游刃有余地穿梭于學(xué)術(shù)界與工業(yè)界,在頂級學(xué)術(shù)會議和開源社區(qū)中留下了眾多硬核代碼。
這一系列突破源于他在核心技術(shù)上的深耕:在高效模型架構(gòu)設(shè)計上,他專注于模型深度擴(kuò)展過程中的通信與內(nèi)存瓶頸優(yōu)化;在訓(xùn)練動態(tài)與效率提升方面,他通過重構(gòu)底層殘差流,從根本上解決了大模型中 PreNorm 導(dǎo)致的梯度稀釋與隱狀態(tài)爆炸問題。
▎賴國堃:

賴國堃是楊植麟的清華兼卡內(nèi)基梅隆大學(xué)雙重校友。
他是 Kimi團(tuán)隊(duì)論文數(shù)量最多的研究者之一,有十余篇論文,他不僅是月之暗面“天才俱樂部”的代表人物之一,是Kimi K3 的核心貢獻(xiàn)者,更是在學(xué)術(shù)界擁有“定義級”成果的大神。
在加入月之暗面之前,賴國堃已經(jīng)在 NLP(自然語言處理)領(lǐng)域留下了兩個行業(yè)標(biāo)準(zhǔn)級的重磅成果。
一個是打造了全球最大的機(jī)器閱讀理解數(shù)據(jù)集之一 “RACE 數(shù)據(jù)集”,RACE 數(shù)據(jù)集直接用中國學(xué)生英語考試題訓(xùn)練 AI,成為了全球機(jī)器閱讀理解的標(biāo)尺。
更驚人的是,他在本科時期寫的一篇關(guān)于推薦算法的論文《Explicit factor models for explainable recommendation 》,在十年后的 2024 年還拿到了 SIGIR 時間檢驗(yàn)獎,這是信息檢索領(lǐng)域的最高榮譽(yù)之一,專門頒發(fā)給 10 年前發(fā)表、經(jīng)得起時間考驗(yàn)、對行業(yè)產(chǎn)生持久影響的論文。
這種在本科階段就具備‘定義未來十年技術(shù)路線’能力的人,在月之暗面并不是孤例。
賴國堃專攻方向非常契合 Kimi 的核心能力,比如其擅長“機(jī)器閱讀理解 ”,解決的是如何讓 AI 讀懂長文檔并回答問題的,這正是 Kimi 長文本能力的核心技術(shù)底座。
預(yù)訓(xùn)練大模型是他在 CMU 期間的研究重點(diǎn)之一,此外還專攻神經(jīng)架構(gòu)搜索,研究如何讓 AI 自動設(shè)計更好的網(wǎng)絡(luò)結(jié)構(gòu)。以及可解釋性推薦系統(tǒng),讓 AI 不僅推薦內(nèi)容,還能告訴用戶為什么推薦這個。
▎郭海清:
郭海清(Haiqing Guo)是月之暗面 Kimi 團(tuán)隊(duì)的早期核心研發(fā)成員,屬于團(tuán)隊(duì)元老級人物,全程參與 Kimi 多代核心項(xiàng)目的研發(fā)迭代。
公開可核實(shí)的參與項(xiàng)目包括 Kimi k1.5 技術(shù)報告、Kimi K2 技術(shù)報告、注意力殘差(AttnRes)核心架構(gòu)論文、Kimi K3 技術(shù)報告。其中 AttnRes 是 Kimi K3的兩大核心架構(gòu)創(chuàng)新之一。
從署名軌跡來看,他覆蓋了 Kimi 從 k1.5 到 K3 三代旗艦版本的完整迭代周期,參與范圍貫穿多代產(chǎn)品的核心研發(fā)環(huán)節(jié),是 Kimi 技術(shù)團(tuán)隊(duì)的持續(xù)核心參與者。目前公開渠道暫未披露其具體崗位與細(xì)分研發(fā)分工。
▎陳廣宇:

陳廣宇恐怕是月之暗面最年輕的研究員,09 年出生, 17 歲,一個曾讓埃隆·馬斯克(Elon Musk)在 X 上公開驚嘆 “Impressive” 的少年。
在月之暗面推出震驚世界的 2.8 萬億參數(shù)旗艦 Kimi K3 時,他已經(jīng)和技術(shù)大牛蘇劍林等人并列,成為了 Kimi K3 核心架構(gòu)奠基作《Attention Residuals》的共同第一作者。
他參與的注意力殘差(Attention Residuals)機(jī)制,直接對深度學(xué)習(xí)領(lǐng)域沿用了近十年的標(biāo)準(zhǔn)殘差連接動了刀,用“可學(xué)習(xí)的深度注意力”讓模型能夠聰明地“回頭看”,這一底層重構(gòu)直接將模型的擴(kuò)展效率拉高了 1.25 倍,讓中國公司在萬億規(guī)模的頂級算力戰(zhàn)局里,能夠以更低的開銷跑得更快。
他加入月之暗面的故事十分神奇。一年前的他甚至連什么是 Transformer 都不知道,因在一場黑客松中想出過“人類第三只機(jī)械輔助手”的構(gòu)想而被硅谷初創(chuàng)公司挖掘 。7 周后,他被 Kimi 團(tuán)隊(duì)徹底看中并破格接入了公司的核心研究組 。在入職的第一周,他就打破一切常規(guī),直接手撕并斬獲了 Kimi 內(nèi)部 48 小時極限黑客馬拉松的總冠軍 。
▎杜昂昂:
在 Kimi 的技術(shù)報告里,杜昂昂的名字一直在最前面。他是月之暗面多模態(tài)體系的核心骨干之一,是 Kimi 技術(shù)報告中少有的五代全勤的研究者。他曾兩度拿下團(tuán)隊(duì)署名后的第一順位,推測他在 Kimi K3 中的核心貢獻(xiàn)在視覺領(lǐng)域。
在加入月之暗面之前,杜昂昂就已經(jīng)在計算機(jī)視覺領(lǐng)域打下了兩項(xiàng)分量十足的根基。
一個是水下顯微視覺方向的深耕。本碩七年就讀于中國海洋大學(xué)水下視覺實(shí)驗(yàn)室,專攻難度極高的浮游生物顯微圖像分類——要在成像模糊、樣本稀缺、物種差異極細(xì)微的顯微鏡畫面里,讓 AI 精準(zhǔn)識別海洋中最小的生命。
2020 年他以第一作者身份在 Global OCEANS 發(fā)表相關(guān)研究,用二階特征建模破解了細(xì)粒度分類難題,是實(shí)驗(yàn)室十年該方向研究中,唯一由碩士生擔(dān)任第一作者的成果。
更具行業(yè)影響力的是他在曠視科技時期的產(chǎn)出。他參與的多人姿態(tài)估計研究被計算機(jī)視覺頂會 ECCV 2020 收錄,論文累計引用超 300 次,成為人體姿態(tài)估計領(lǐng)域的重要參考。這篇工作的合作者名單里,既有孫劍、張祥雨等視覺領(lǐng)域領(lǐng)軍人物,也有后來的月之暗面聯(lián)合創(chuàng)始人周昕宇。
來到 Kimi 后他深耕視覺編碼器設(shè)計、多模態(tài)對齊與視覺智能體技術(shù),尤其擅長高分辨率圖像理解、長時序視頻解析與多模態(tài)強(qiáng)化學(xué)習(xí),這正是 Kimi 原生多模態(tài)能力的核心技術(shù)底座。除此之外,他的能力還向下延伸至大模型訓(xùn)練基建——從優(yōu)化器穩(wěn)定性到智能體數(shù)據(jù)合成,形成了從底層視覺算法到模型訓(xùn)練、再到上層智能體落地的全棧能力。
2025 年他以第一作者發(fā)布 Kimi-VL 開源多模態(tài)模型,自研 MoonViT 視覺編碼器原生支持超高分辨率輸入,搭配128K 長上下文能力,讓 Kimi 首次具備了通讀長視頻、長文檔的多模態(tài)長文本理解能力,奠定了 Kimi 全系多模態(tài)能力的技術(shù)底座。
K2 階段,他深度參與 MuonClip 優(yōu)化器研發(fā),配合 QK-Clip 機(jī)制攻克大模型訓(xùn)練抖動的行業(yè)痛點(diǎn),支撐 15.5 萬億Token 超大規(guī)模訓(xùn)練實(shí)現(xiàn)“零損失尖峰”,大幅壓低了訓(xùn)練的算力成本與風(fēng)險;到 K3 階段,他主導(dǎo)的智能體數(shù)據(jù)合成流水線,讓模型可以自主生成高質(zhì)量訓(xùn)練數(shù)據(jù),為 K3 在編程、智能體等硬核任務(wù)上躋身全球第一梯隊(duì)提供了關(guān)鍵的數(shù)據(jù)支撐。
對 Kimi 而言,他的貢獻(xiàn)貫穿了多模態(tài)能力的整條演進(jìn)路徑。
▎瞿博文:

瞿博文(Bowen Qu / Brian Qu)隸屬于模型后訓(xùn)練團(tuán)隊(duì),本科畢業(yè)于華中科技大學(xué)電子信息與通信學(xué)院,碩士畢業(yè)于北京大學(xué)電子學(xué)院。他的研究主攻多模態(tài)大模型相關(guān)方向,具體覆蓋多模態(tài)強(qiáng)化學(xué)習(xí)、視覺語言模型、AI 智能體以及 AIGC 內(nèi)容質(zhì)量評估。
加入月之暗面后,瞿博文的核心工作圍繞 Kimi 系列模型的多模態(tài)能力建設(shè)展開,深度參與 Kimi-K2.5 項(xiàng)目,并參與原生多模態(tài)強(qiáng)化學(xué)習(xí)方向的研發(fā)。Kimi-K2.5 是月之暗面推出的原生多模態(tài)智能體模型,總參數(shù)規(guī)模 1T,激活參數(shù) 32B。
瞿博文負(fù)責(zé)的原生多模態(tài)強(qiáng)化學(xué)習(xí)體系,跳出了傳統(tǒng)多模態(tài)模型先完成視覺監(jiān)督微調(diào)、再開展強(qiáng)化學(xué)習(xí)的常規(guī)路徑,提出從零視覺監(jiān)督微調(diào)的純文本推理模型出發(fā),直接通過視覺強(qiáng)化學(xué)習(xí)獲取視覺推理能力的訓(xùn)練方案,避免低質(zhì)量視覺數(shù)據(jù)對模型原生語言推理能力造成干擾。
瞿博文的研究起步于 AIGC 內(nèi)容質(zhì)量評估方向,相關(guān)成果先后發(fā)表于 ICME 2024、CVPRW 2024 等國際會議。其中發(fā)表于 ICME 2024 的相關(guān)論文,針對當(dāng)時 AI 生成圖像評價體系僅關(guān)注畫面美觀度、清晰度,忽略生成內(nèi)容與用戶指令匹配度的問題,提出將文本提示詞納入生成圖像質(zhì)量評價體系的方案,構(gòu)建了同時覆蓋視覺質(zhì)量與指令遵循度的評價標(biāo)準(zhǔn),提升了 AI 生成內(nèi)容評價的全面性與人類感知對齊程度。
瞿博文也出現(xiàn)在 Kimi 系列多模態(tài)版本的貢獻(xiàn)者名單中。作為年輕研究者,瞿博文的研究路徑從評價體系搭建延伸至模型能力建設(shè),再落地到高階智能體能力研發(fā),成果緊密貼合產(chǎn)業(yè)實(shí)際需求,直接服務(wù)于生產(chǎn)級模型的迭代升級。
▎鹿恩哲:
在 Kimi K3 四百余人的貢獻(xiàn)者名單里, 鹿恩哲 不是署名位置最靠前的,但出手異常精準(zhǔn)。每一項(xiàng)成果都命中大模型落地的核心痛點(diǎn),是 Kimi 高效算力體系的關(guān)鍵搭建者。
鹿恩哲的研究方向可以用三個字精準(zhǔn)概括:長、快、省,核心目標(biāo)就是讓大模型用更低的成本、更快的速度,處理更長的文本。對 Kimi 而言,他的所負(fù)責(zé)的是從訓(xùn)練到推理的全鏈路效率升級。
2025 年 2 月,他以第一作者身份發(fā)布 MoBA 混合塊注意力機(jī)制,把 MoE 的專家選擇思路遷移到注意力層,讓模型處理請求時只調(diào)取最相關(guān)的上下文塊做計算。在 95% 稀疏度下效果與全注意力持平,實(shí)現(xiàn)百萬 token 推理提速 6.5 倍、千萬 token 提速 16 倍,直接打牢了 Kimi 超長上下文能力的底層架構(gòu)。
發(fā)布當(dāng)天該論文與 DeepSeek 的 NSA 論文同期亮相,成為當(dāng)年國內(nèi)大模型圈最受關(guān)注的技術(shù)撞車事件;更能體現(xiàn)其工程價值的是,在被 NeurIPS 2025 收錄為 Spotlight 論文之前,這套方案已經(jīng)在 Kimi 生產(chǎn)環(huán)境穩(wěn)定承載了近一年的長上下文用戶請求。
除此之外,從 MoBA 到 Kimi Linear 的 KDA 注意力,他參與的架構(gòu)設(shè)計全程死磕硬件推理效率;在訓(xùn)練側(cè),他參與的 Muon 優(yōu)化器分布式實(shí)現(xiàn)做到內(nèi)存占用最優(yōu)、通信開銷高效,實(shí)打?qū)崏嚎s大模型訓(xùn)練的算力成本。算上 AttnRes 以及 K1.5、K2、Kimi-VL 等多代技術(shù)報告,他的論文完整覆蓋了高效大模型的全鏈路技術(shù)。
在團(tuán)隊(duì)內(nèi)部,他與 MoBA 論文的通訊作者之一邱杰仲是固定搭檔,一個沖鋒落地,一個把控方向,配合默契。
▎汪彧之:

汪彧之是月之暗面(Moonshot AI)的一名研究員,也是 Kimi 系列技術(shù)報告中出鏡率最高的署名者之一。
從 2025 年 1 月的 k1.5 到 2026 年 7 月的 Kimi K3,他的名字出現(xiàn)在這家公司幾乎每一份技術(shù)文件上,涵蓋視覺、音頻、注意力架構(gòu)、訓(xùn)練優(yōu)化器、旗艦?zāi)P湍酥燎把?AI 風(fēng)險治理框架。
他是西安電子科技大學(xué)本科,清華大學(xué)電子工程系博士,加入曠視研究院后任研究工程師;2024 年加入月之暗面任研究員至今。
在加入月之暗面之前,他的研究集中在計算攝影與底層視覺。代表性成果包括:以第一作者在 ECCV 2020 發(fā)表手機(jī)端 RAW 圖像降噪論文,該方向至今是移動影像的標(biāo)桿工作之一;作為曠視團(tuán)隊(duì)成員獲得 NTIRE 2019 真實(shí)圖像去噪挑戰(zhàn)賽 raw-RGB 賽道全球冠軍;以共同作者身份參與 OCR 領(lǐng)域經(jīng)典工作 EAST(CVPR 2017,引用超 2500 次)。
在月之暗面期間,他參與署名的技術(shù)文件共十份,包括: k1.5、K2、K3,Kimi-VL、Kimi-Audio ,MoBA、Muon、Kimi Linear、Attention Residuals 四篇架構(gòu)與效率論文,以及前沿 AI 風(fēng)險管理框架。
值得注意的是,公司全部四篇架構(gòu)與效率論文他均在作者之列,這種覆蓋廣度在約四百人的貢獻(xiàn)者名單中并不多見。他在 K3 中的具體職責(zé)暫無公開信息。
▎毛紹光:

毛紹光是 Kimi Agent 技術(shù)線的核心骨干,全程參與 K2、K2-Thinking、K2.5、K3 四代旗艦研發(fā),也是業(yè)內(nèi)少有的完整經(jīng)歷 Agent 行業(yè)兩次范式轉(zhuǎn)換的研究者。
加入月之暗面之前,他已是國內(nèi)最早一批 Agent 落地的從業(yè)者。
清華計算機(jī)碩士畢業(yè),在校時排名位列前 0.2%、獲國家獎學(xué)金,先后在香港中文大學(xué)任研究助理、微軟亞洲研究院語音組實(shí)習(xí)。畢業(yè)后他在微軟任職近六年,從研究院工程師成長為資深研發(fā)工程師。
2023 年初參與研發(fā) TaskMatrix.AI,為 ChatGPT 接入上百萬 API 能力;隨后共同提出 Solo Performance Prompting 方法,讓單模型分飾多角色模擬多智能體協(xié)作,相關(guān)技術(shù)落地至 Microsoft 365 Word。
那是 Agent 的“框架時代”——所有能力都靠外部工具拼接、靠 Prompt 引導(dǎo),而他正是這套技術(shù)路線的親歷者與建設(shè)者。
但親手趟過這條路的毛紹光,最先看清了舊范式的瓶頸。2025 年 6 月,他在知乎寫下一段行業(yè)自白:“這個方向越來越?jīng)]意思了,有點(diǎn)加速衰亡的感覺”。
2025年2月加入月之暗面后,他徹底轉(zhuǎn)向“模型即 Agent ”的端到端路線。僅四個月就參與交付了 Kimi 首款 Agent 產(chǎn)品 Kimi Researcher:
不靠任何流程預(yù)設(shè),完全通過端到端強(qiáng)化學(xué)習(xí)訓(xùn)練而成,單任務(wù)平均完成 23 步推理,自主掃描 206 個網(wǎng)頁,可產(chǎn)出帶規(guī)范引用的萬字調(diào)研報告,在 HLE 基準(zhǔn)上達(dá)到 26.9%,刷新當(dāng)時全球最高水平。他也是該產(chǎn)品官方技術(shù)自述的兩位署名作者之一。
此后從 K2 到 K3 的四代旗艦研發(fā),他全程深度參與。HLE 指標(biāo)從 8.6%一路攀升至 26.9%,這條幾乎完全由強(qiáng)化學(xué)習(xí)驅(qū)動的性能曲線,正是他新技術(shù)路線的成績單。
從為大模型外接 API 擴(kuò)展能力,到讓模型內(nèi)生學(xué)會調(diào)用工具、自主完成復(fù)雜任務(wù),毛紹光近十年的職業(yè)軌跡,恰好勾勒出 Agent 行業(yè)從“拼裝組合”走向“原生生長”的完整弧光。親手參與過舊范式,又親手走出新路線,他對行業(yè)的判斷,有著最扎實(shí)的落地成果做支撐。
▎秦若愚(Ruoyu Qin):

秦若愚是清華大學(xué)計算機(jī)系 MADSys 實(shí)驗(yàn)室在讀博士生,師從章明星副教授。他的研究主攻高效機(jī)器學(xué)習(xí)系統(tǒng),具體覆蓋大規(guī)模分布式大語言模型推理服務(wù)、強(qiáng)化學(xué)習(xí) rollout 系統(tǒng)兩大方向。
秦若愚與月之暗面團(tuán)隊(duì)合作研發(fā)的 Mooncake,是一套以 KVCache 為中心的解耦推理架構(gòu)。這套架構(gòu)將 Prefill 與Decode 階段拆分至獨(dú)立集群運(yùn)行,同時把 GPU 集群中閑置的 CPU、內(nèi)存與 SSD 資源整合為分布式緩存池。該成果獲得了存儲領(lǐng)域頂 會 FAST 2025 的 Erik Riedel 最佳論文獎。
Mooncake 是已落地應(yīng)用的生產(chǎn)級服務(wù)平臺,論文摘要開篇即明確標(biāo)注 “Mooncake is the serving platform for Kimi” 。在真實(shí)業(yè)務(wù)負(fù)載下,Mooncake 可使 Kimi 的請求處理量提升 75%;長上下文場景中,有效請求處理能力提升59% 至 498%。目前該系統(tǒng)已部署在數(shù)千個節(jié)點(diǎn)上,每日處理 token 總量超 1000 億。
2024 年,月之暗面與清華 MADSys 實(shí)驗(yàn)室聯(lián)合開源 Mooncake 項(xiàng)目(開源倉庫為 kvcache-ai/Mooncake),截至目前項(xiàng)目 GitHub Star 數(shù)已超過 6000。相關(guān)數(shù)據(jù)與信息可參考 arXiv 論文(編號2407.00079)、清華計算機(jī)系官網(wǎng)公告及項(xiàng)目開源倉庫。
在 Mooncake 之后,秦若愚的研究持續(xù)圍繞推理系統(tǒng)方向深入。他以第一作者身份完成的 Seer 論文入選 OSDI 2026,這項(xiàng)工作針對強(qiáng)化學(xué)習(xí)中的 rollout 性能瓶頸,通過 rollout 切分、上下文感知調(diào)度與分組投機(jī)解碼技術(shù),實(shí)現(xiàn)端到端 rollout 吞吐最高提升 2.04 倍,長尾延遲降低 72% 至 94%。另一篇一作論文 Prefill-as-a-Service,則進(jìn)一步提出了 KVCache 跨數(shù)據(jù)中心共享的下一代推理架構(gòu)設(shè)計思路。
秦若愚也出現(xiàn)在 K3 項(xiàng)目的貢獻(xiàn)者名單中。大模型的產(chǎn)品表現(xiàn)由兩方面能力共同支撐:模型研發(fā)決定模型的能力上限,系統(tǒng)工程則決定高并發(fā)場景下服務(wù)的可用性與運(yùn)行成本。
當(dāng)前大模型行業(yè)的競爭,正從訓(xùn)練能力的比拼逐步延伸至服務(wù)工程能力的較量。作為在讀博士生,秦若愚能在該領(lǐng)域產(chǎn)出頂會最佳論文級別的成果,核心在于其研究直接面向生產(chǎn)場景,成果落地于真實(shí)業(yè)務(wù)系統(tǒng)。
▎袁恩銘:

月之暗面 Kimi 團(tuán)隊(duì)核心研發(fā)成員,研究軌跡橫跨計算生物學(xué)、推薦系統(tǒng)與大模型三大領(lǐng)域,全程參與 Kimi 多代核心模型的技術(shù)迭代。
早期他于清華大學(xué)交叉信息研究院曾堅陽課題組從事 AI 制藥方向研究。2020 至 2021 年間,他參與的流感藥物重定位框架研究先后發(fā)布于 bioRxiv 預(yù)印本與期刊《Signal Transduction and Targeted Therapy》,另有核衣殼蛋白相分離相關(guān)成果發(fā)表于《Protein & Cell》。
2022 至 2023 年,袁恩銘任職于華為諾亞方舟實(shí)驗(yàn)室,聚焦推薦系統(tǒng)方向研究,成果覆蓋多個國際頂級學(xué)術(shù)會議。其中他以第一作者完成的多行為序列推薦相關(guān)論文入選 SIGIR 2022,另有合作成果分別入選 CIKM 2022 與 WWW 2023。
加入月之暗面后,袁恩銘深度參與 Kimi 多代核心模型與技術(shù)項(xiàng)目研發(fā),公開可核實(shí)的署名項(xiàng)目包括 Kimi k1.5 強(qiáng)化學(xué)習(xí)技術(shù)報告、MoBA 技術(shù)研究、Kimi-VL 技術(shù)報告、Kimi K2 大模型技術(shù)報告、Kimi Linear 技術(shù)報告、Kimi K2.5 多模態(tài)模型技術(shù)報告與 Kimi K3 旗艦大模型技術(shù)報告。
其參與范圍覆蓋強(qiáng)化學(xué)習(xí)訓(xùn)練、多模態(tài)能力、基礎(chǔ)模型架構(gòu)、長上下文系統(tǒng)等多個核心技術(shù)方向,完整貫穿 Kimi 從 k1.5 到 K3 的三代旗艦?zāi)P偷芷冢菆F(tuán)隊(duì)內(nèi)技術(shù)覆蓋維度較廣的核心研發(fā)人員。
目前公開渠道暫未披露袁恩銘在月之暗面的具體崗位與細(xì)分研發(fā)分工。從公開署名軌跡來看,跨領(lǐng)域的研究背景支撐了他在大模型多技術(shù)方向的參與能力,是 Kimi 技術(shù)體系迭代過程中的重要持續(xù)參與者。
▎許偉欣:
許偉欣現(xiàn)任月之暗面(Moonshot AI)研究員,研究方向覆蓋大模型基礎(chǔ)架構(gòu)、高效訓(xùn)練機(jī)制與 Attention 機(jī)制優(yōu)化。
許偉欣深度參與 Kimi 多代核心模型與底層技術(shù)研發(fā),公開署名項(xiàng)目覆蓋從 k1.5 到 K3 的完整產(chǎn)品迭代周期。月之暗面官方在 K3 發(fā)布后公開披露了三大核心自研技術(shù)——Muon 系優(yōu)化器、Kimi Linear 線性注意力、Attention Residuals 注意力殘差,Weixin Xu 是目前可核實(shí)的、唯一在三篇對應(yīng)核心技術(shù)論文中均署名且順位均在前 15 位的貢獻(xiàn)者,是支撐 K3 架構(gòu)性能升級的核心研發(fā)人員之一。
具體成果方面,2025 年 2 月發(fā)布的 Muon 優(yōu)化器論文中,他位列作者名單第 8 位,該優(yōu)化器計算效率約為 AdamW 的兩倍,后續(xù)配套開源的 Moonlight 訓(xùn)練實(shí)現(xiàn)同樣有其參與;
2025 年 10 月發(fā)布的 Kimi Linear 技術(shù)論文中,他位列第 15 位,該架構(gòu)提出的 KDA 機(jī)制可將 KV Cache 體積最高降低 75%,百萬 token 場景下解碼吞吐最高提升 6 倍百萬 token 場景下解碼吞吐最高提升 6 倍;
2026 年 3 月發(fā)布的 Attention Residuals 論文(K3 兩大核心架構(gòu)創(chuàng)新之一)中,他位列第 4 位,是三位共同一作之后的首位核心貢獻(xiàn)者,相關(guān)技術(shù)已深度集成進(jìn) Kimi K3 基礎(chǔ)模型架構(gòu)。
除此之外,他的署名還出現(xiàn)在 Kimi k1.5 強(qiáng)化學(xué)習(xí)技術(shù)報告、Kimi-VL 技術(shù)報告、Kimi K2 與 K2.5 技術(shù)報告,以及最新的 Kimi K3 旗艦?zāi)P图夹g(shù)報告貢獻(xiàn)者名單中,參與范圍覆蓋基礎(chǔ)模型、多模態(tài)、強(qiáng)化學(xué)習(xí)等多個核心研發(fā)方向。需明確的是,MoBA 論文作者列表中無其署名,二者不存在公開可查的研發(fā)關(guān)聯(lián)。
此外,他還參與了 OccDepth 三維語義場景補(bǔ)全、PVD-AL 主動學(xué)習(xí)蒸餾、ACCV 2024 隱式 SDF 重建等多項(xiàng)三維視覺方向研究,學(xué)術(shù)成果覆蓋模型壓縮、3D 重建、語義場景理解等多個細(xì)分領(lǐng)域。
從公開署名軌跡來看,許偉欣的研究路徑從端側(cè)模型部署、三維視覺感知逐步延伸至大模型底層架構(gòu)創(chuàng)新,長期深耕高效計算方向,技術(shù)覆蓋跨度廣,是月之暗面底層技術(shù)棧迭代的核心持續(xù)參與者核心持續(xù)參與者。
▎杜晨壯:

杜晨壯是月之暗面的核心研究員,是團(tuán)隊(duì)里負(fù)責(zé)強(qiáng)化學(xué)習(xí)與推理能力擴(kuò)展的核心中堅力量。
他本科畢業(yè)于北京航空航天大學(xué)信息管理與信息系統(tǒng)專業(yè),隨后進(jìn)入大模型人才的黃埔軍校——清華大學(xué)交叉信息研究院讀博。
在清華期間,他師從人工智能領(lǐng)域知名學(xué)者趙行,并加入了聲名顯赫的 MARS Lab(多模態(tài)與自主推理實(shí)驗(yàn)室),開始聚焦多模態(tài)機(jī)器學(xué)習(xí)、強(qiáng)化學(xué)習(xí)以及大語言模型強(qiáng)化機(jī)制。
在博士求學(xué)期間,他作為核心作者研發(fā)了轟動一時的《ChatDB》架構(gòu),開創(chuàng)性地提出“用數(shù)據(jù)庫作為符號性記憶模塊增強(qiáng)大模型”,在當(dāng)時的AI學(xué)術(shù)界和工業(yè)界一舉刷屏。
為了更早地積累工業(yè)級大系統(tǒng)的實(shí)戰(zhàn)經(jīng)驗(yàn),他還在讀博期間加入了北京海華人工智能研究院擔(dān)任實(shí)習(xí)生,深度參與了從零開始搭建底層系統(tǒng)的硬核研究項(xiàng)目。這讓他在多模態(tài)與強(qiáng)化學(xué)習(xí)領(lǐng)域積累了不少經(jīng)驗(yàn),更具備了系統(tǒng)加算法的底層視野。
他畢業(yè)后加入月之暗面,頻繁出現(xiàn)在核心模型的技術(shù)報告中。他直接參與了探索強(qiáng)化學(xué)習(xí)擴(kuò)展律的重磅論文《Kimi k1.5: Scaling Reinforcement Learning with LLMs》,同時在 Kimi K2 和 K2.5 等旗艦系列模型的技術(shù)報告中也都扮演了核心貢獻(xiàn)者的角色。
他還作為核心共同作者深度參與了 Kimi 多模態(tài)視覺大模型《Kimi-VL Technical Report》的研發(fā),專注于提升大模型對復(fù)雜圖像、圖表以及真實(shí)世界視覺信息的感知與多模態(tài)深度推理能力。
杜晨壯的主攻方向是大規(guī)模大語言模型(LLM)訓(xùn)練工程,專注于萬億級大模型(MoE 架構(gòu))在超級集群中的資源調(diào)度、穩(wěn)定訓(xùn)練與極限系統(tǒng)優(yōu)化;以及強(qiáng)化學(xué)習(xí)與多模態(tài)融合,研究模型如何在復(fù)雜長推理任務(wù)下通過自監(jiān)督、強(qiáng)化學(xué)習(xí)實(shí)現(xiàn)智能上限的跨越,并實(shí)現(xiàn)視覺信息與語言模型的高效底層融合。
▎Yanru Chen:
Yanru Chen 是月之暗面的核心研究員,專注于大模型底層架構(gòu)、長文本技術(shù)、算力優(yōu)化與多模態(tài)工程的研發(fā)與落地。
作為 《Attention Residuals》 論文的共同作者,他參與重構(gòu)了大模型深度方向的信息流動方式,成功攻克了超深網(wǎng)絡(luò)訓(xùn)練效率低下和信息流阻斷的行業(yè)痛點(diǎn)。
在長文本核心技術(shù)上,他作為 MoBA(混合塊注意力) 的共同作者,主導(dǎo)并參與了 Kimi 最看家的底層機(jī)制研發(fā),通過塊級別的注意力切分,直接解決了百萬級超長上下文在預(yù)訓(xùn)練和推理端算力消耗過大的問題,成為 Kimi 極限降本增效的核心底座。
同時,他還是 《Muon is Scalable for LLM Training》 論文的共同作者,深度參與了重磅開源項(xiàng)目 Moonlight 及其底層 Muon 優(yōu)化器 的研發(fā),通過矩陣正交化處理挑戰(zhàn)了傳統(tǒng)的 AdamW,極大地壓縮了萬億大模型在分布式訓(xùn)練中的算力開銷。
在旗艦?zāi)P偷校疃惹度肓?Kimi 歷代核心旗艦(k1.5、K2、K2.5、K3)的研發(fā)全生命周期,解決了模型在大標(biāo)度強(qiáng)化學(xué)習(xí)和萬億參數(shù)擴(kuò)展下的穩(wěn)定性與資源調(diào)度難題。
此外,在 Kimi 多模態(tài)線(Linear、VL、Audio) 的技術(shù)攻堅中,他積極探索非傳統(tǒng) Transformer 結(jié)構(gòu)的線性注意力創(chuàng)新,并主導(dǎo)推動了 Kimi 視覺與音頻多模態(tài)技術(shù)報告的工程落地,高效解決了多模態(tài)信息流在底層融合時的效率瓶頸。
▎劉少偉:
劉少偉是清華大學(xué)頂級計算機(jī)系統(tǒng)實(shí)驗(yàn)室 MADSys 實(shí)驗(yàn)室的核心成員,同時也是月之暗面核心基礎(chǔ)設(shè)施(Infra)團(tuán)隊(duì)的領(lǐng)軍專家。
當(dāng)你感嘆 Kimi 坐擁萬億參數(shù)、API 價格卻極低,背后正是他與團(tuán)隊(duì)死磕的“極致量化藝術(shù)”。他常年深耕萬億級大模型的極致低成本推理、原生量化與大規(guī)模分布式計算拓?fù)湓O(shè)計。
在全球最硬核的 AI 開源社區(qū) Reddit LocalLLaMA 上,他曾以 Kimi 官方專家的身份,發(fā)表了轟動海外極客圈的技術(shù)拆解長文《Kimi infra team: Quantization is not a compromise, it's the next paradigm》 。這篇長文深度揭秘了 Kimi K2 與 K2.5 底層極其硬核的 Native INT4 原生量化格式 。
他不僅是 MoBA(混合塊注意力機(jī)制)的核心共同作者 ,更深度參與了重磅開源項(xiàng)目 Moonlight 及其底層 Muon 優(yōu)化器的分布式架構(gòu)研發(fā),通過矩陣正交化處理極大地壓縮了萬億大模型在分布式訓(xùn)練中的算力開銷 。
他還是月之暗面重磅開源項(xiàng)目KTransformers 的核心發(fā)起人和代碼維護(hù)者之一,親手打通了異構(gòu)集群下萬億 MoE 模型混合推理的算力屏障 。
▎陳冠多:

陳冠多是月之暗面的 Infra 團(tuán)隊(duì)核心研究員。他具備極強(qiáng)的“系統(tǒng)+算法”跨界研發(fā)能力,他的研究領(lǐng)域高度聚焦于大模型基礎(chǔ)設(shè)施(Infra)、高效注意力機(jī)制架構(gòu)(Efficient Attention Architecture)、大模型微調(diào)加速以及大規(guī)模存儲與檢索優(yōu)化。
他本科與碩士均畢業(yè)于復(fù)旦大學(xué)計算機(jī)系,在分布式系統(tǒng)與底層架構(gòu)領(lǐng)域打下了堅實(shí)的專業(yè)基礎(chǔ)。隨后,他前往南洋理工大學(xué)與香港科技大學(xué)進(jìn)行深造,期間分別師從高性能計算與大模型基礎(chǔ)設(shè)施領(lǐng)域的知名學(xué)者袁斌航和羅思強(qiáng),積累了前沿的學(xué)術(shù)視野與研發(fā)經(jīng)驗(yàn)。
在正式加入月之暗面之前,他曾在頂尖互聯(lián)網(wǎng)大廠的底層核心部門進(jìn)行深度沉淀。他曾先后在字節(jié)跳動數(shù)據(jù)庫系統(tǒng)研發(fā)團(tuán)隊(duì)以及美團(tuán)基礎(chǔ)設(shè)施團(tuán)隊(duì)擔(dān)任研究實(shí)習(xí)生,深度參與了工業(yè)級高并發(fā)、大規(guī)模分布式系統(tǒng)的研發(fā)與架構(gòu)優(yōu)化。
期間,他作為核心作者直接扔出了兩項(xiàng)重磅成果。在底層存儲上,他研發(fā)并發(fā)表了《Oasis》,提出了一種最優(yōu)不相交分割學(xué)習(xí)范圍濾波器,直接解決了底層數(shù)據(jù)庫在大規(guī)模范圍查詢時的索引瓶頸;
在應(yīng)用層落地中,他發(fā)表了《Gar》,通過一種“生成和排序”的方法,大幅提升了大模型精準(zhǔn)理解人類復(fù)雜意圖并轉(zhuǎn)化為 SQL 數(shù)據(jù)庫查詢語句(Text-to-SQL)的準(zhǔn)確率。
陳冠多于 2025 年 3 月正式加入月之暗面。作為 Infra 團(tuán)隊(duì)的中堅力量,他不僅是月之暗面旗艦大模型 Kimi K2 和 Kimi K2.5 的核心共同作者,還在大模型微調(diào)加速、高效注意力架構(gòu)、甚至是網(wǎng)絡(luò)架構(gòu)重構(gòu)等方向,密集輸出了多項(xiàng)技術(shù)突破。
為了解決大模型微調(diào)太燒顯存的問題,陳冠多主導(dǎo)發(fā)表了《Ce-lora》論文,提出了一種計算高效型 LoRA 微調(diào)方法。這項(xiàng)技術(shù)通過降低大模型參數(shù)微調(diào)時的顯存占用與計算開銷,直接拉高了 Infra 層的訓(xùn)練吞吐量,堪稱大模型微調(diào)的“顯存瘦身術(shù)”。
面對長文本計算復(fù)雜度呈平方級爆炸的問題,他參與研發(fā)并發(fā)表了轟動開源社區(qū)的 《Kimi Linear》 架構(gòu)。這是一種富有表現(xiàn)力且高效的線性注意力架構(gòu),在保持模型強(qiáng)大表征能力的同時,極大降低了長文本計算的復(fù)雜度,成功將 KV Cache(鍵值緩存)占用最高砍掉 75%,并在百萬文本長度下跑出了 6倍的解碼吞吐量,是 Kimi 持續(xù)深耕長文本技術(shù)壁壘的硬核底座。
他還是《Attention Residuals》 的共同作者之一。
從最底層的存儲過濾器、計算高效的微調(diào)算法,到顛覆性的下一代 Transformer 網(wǎng)絡(luò)架構(gòu),陳冠多的職業(yè)生涯軌跡完美契合了當(dāng)下大模型從“單純卷參數(shù)”向“追求極致計算效率與工程落地”的行業(yè)范式。

03
K3 的研發(fā)團(tuán)隊(duì)素來低調(diào)神秘,在梳理資料的過程中,我們也很難一一厘清全部成員的具體分工與完整履歷。但透過這份沉甸甸的名單,答案已然浮出水面:為什么是月之暗面?為什么他們能撐起人均7億的超級估值?
這群平均年齡不到 30 歲的年輕人,是真正懂算力經(jīng)濟(jì)學(xué)的系統(tǒng)架構(gòu)師。從斬獲頂會最佳論文的存儲調(diào)度,到重構(gòu)注意力機(jī)制的底層創(chuàng)新,他們將“長、快、省”的工程效率做到了極致。
正是這種從上層算法直到底層硬件的全棧打通,賦予了月之暗面打破“算力同質(zhì)化”魔咒的核心壁壘。
還一個有趣的細(xì)節(jié)是,在全員名單的結(jié)尾,Kimi K3 也成為整個研發(fā)團(tuán)隊(duì)的重要成員。創(chuàng)造者與被創(chuàng)造者開始在同一張名單上并肩而立,屬于中國大模型的“黃金時代”,已然轟鳴而至。

參考鏈接:
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf



上車,雷峰網(wǎng)(公眾號:雷峰網(wǎng))帶你看遍全球 AI 頂會精華
可獨(dú)家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學(xué)術(shù)新星訪談

掃描上方二維碼
或點(diǎn)擊「閱讀原文」關(guān)注專區(qū)。
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。