前瞻與傳聞
傳字節跳動探討訓練逾5兆參數AI模型,張一鳴表態反對模型蒸餾
DigiTimes綜合 2 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。

據《晚點 LatePost》與外媒報導,字節跳動正探討訓練參數規模超過 5 兆的大型 AI 模型。該計畫尚處早期階段,若落實將超越阿里 Qwen 3.8-Max(2.4 兆參數)與月之暗面 K3(2.8 兆參數),成為中國已知參數規模最大的模型。消息指出,此計畫將由 Seed Foundation 負責人項亮與 LLM 預訓練資料負責人沈科主導。
報導指出,字節跳動創辦人張一鳴在近期的 Seed 團隊全員會議上安撫團隊焦慮,明確表示可接受模型在一段時間內落後於同業,期望團隊以追求智慧上限為目標,躋身世界第一梯隊。張一鳴同時表態反對使用「蒸餾」(Distillation)技術來訓練 AI 模型;他認為蒸餾雖能短期改善表現,但本質上只是在複製 Claude 等既有模型的能力,沿此路徑最多只能逼近對手,無法真正實現超越。此外,他指出程式設計(Programming)是當前的關鍵發展方向。
讀原始報導背景
AI 蒸餾(distillation)技術在去年引發廣泛關注。當時 OpenAI 曾指控 DeepSeek 利用此技術,基於開源系統打造出強大且高效的 AI 模型。
這則事件的發展
來源
相關主題