研究與評測
LinkedIn 公布基於 SGLang 的多教師蒸餾框架:將 8B 模型知識壓縮至 600M 排序模型,訓練提速 8 倍
AI 前線單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,LinkedIn 公布其 AI 驅動職位搜索背後的訓練基礎設施,介紹了一套基於開源引擎 SGLang 構建的多教師蒸餾框架。該框架將一個 80 億參數的相關性預言模型與一個 17 億參數的互動教師模型的知識,壓縮至 6 億參數的學生排序模型中。此舉將職位搜索的 NDCG@10 從 0.7583 提升至 0.9432。
系統支援線上與離線蒸餾。線上模式透過在多節點部署本地教師模型副本並進行非同步查詢,將蒸餾提速 3 倍;離線模式則預先計算並將結果儲存於 HDFS 或 NFS,避免即時查詢的重複計算。結合多項訓練層最佳化技術,包含採用 LiGer 降低記憶體使用並將批次大小擴大 2 倍、多節點訓練(最高加速 3.5 倍)、FSDP2(提升 20%)以及 H200 多節點集群(最高提升 30%),整體訓練速度提升約 8 倍。團隊實測指出,對於參數低於 80 億的模型,FP8 混合精度的類型轉換開銷大於計算節省,因此並未採用。
在推論側,透過結構化剪枝與上下文壓縮,單塊 GPU 的排序吞吐量從每秒約 290 條提升至 2000 條以上。該系統已投入生產,支援 LinkedIn 美國用戶的自然語言職位搜索。
讀原始報導背景
SGLang(Structured Generation Language)是由 LMSYS 等機構研究人員推出的開源高效能服務框架,專為大型語言模型與多模態模型設計。該系統結合了用於結構化生成的 Python 嵌入語言與高吞吐量推論的執行環境,旨在提供低延遲的模型服務。