DeepSeek V4正式版即將于7月中旬上線前夕,一位清華學霸悄然出現在DeepSeek V4論文作者名單中。
清華大學2021級博士生、2025年研究生特等獎學金獲得者顧煜賢(Yuxian Gu),已正式加入DeepSeek。
清華本博連讀,師從黃民烈教授
顧煜賢本科和博士均就讀于清華大學計算機系,現為畢業年級博士生,師從交互式人工智能課題組(CoAI)黃民烈教授。
2025年,他獲得清華大學研究生特等獎學金——清華在校學生的最高榮譽。此外,他還曾獲得蘋果學者獎學金(2025年全球僅21人,中國大陸僅2人)、螞蟻In-Tech獎學金及鐘士模獎學金等多項榮譽。
論文引用近5000次,MiniLLM被谷歌英偉達采用
顧煜賢的Google Scholar引用量已近5000次。他多次以第一作者身份在NeurIPS、ICLR、ACL等AI頂會發表論文。
其研究方向聚焦大語言模型全生命周期的效率提升,涵蓋預訓練、下游適配和推理三大階段。代表性成果包括:
MiniLLM:一種大模型知識蒸餾方法,采用反向KL散度替代傳統方案,使學生模型生成更精準的回答。該技術已被Google DeepMind、英偉達、阿里、小米等多家公司采用。論文兩年半被引近1000次。
Jet-Nemotron:一種混合架構語言模型,僅2B參數即可趕超Qwen3、Gemma3等SOTA模型,在H100 GPU上實現53.6倍的生成吞吐量加速。
顧煜賢曾在接受采訪時表示: “在硬件被‘卡脖子’的當下,我們必須用‘算法’的創新來彌補‘算力’的短板。”
這一理念與DeepSeek追求極致效率的技術路線不謀而合。DeepSeek V4系列包含Pro(1.6T參數,49B激活)和Flash(284B參數,13B激活)兩個版本,均支持百萬Token上下文。顧煜賢在模型壓縮和高效架構方面的積累,或將在新版本中發揮關鍵作用。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.