跳到主要內容
2026-08-07 日報
前瞻與傳聞

傳字節跳動探討訓練逾5兆參數AI模型,張一鳴表態反對模型蒸餾

DigiTimes綜合 2 家報導多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

據《晚點 LatePost》與外媒報導,字節跳動正探討訓練參數規模超過 5 兆的大型 AI 模型。該計畫尚處早期階段,若落實將超越阿里 Qwen 3.8-Max(2.4 兆參數)與月之暗面 K3(2.8 兆參數),成為中國已知參數規模最大的模型。消息指出,此計畫將由 Seed Foundation 負責人項亮與 LLM 預訓練資料負責人沈科主導。 報導指出,字節跳動創辦人張一鳴在近期的 Seed 團隊全員會議上安撫團隊焦慮,明確表示可接受模型在一段時間內落後於同業,期望團隊以追求智慧上限為目標,躋身世界第一梯隊。張一鳴同時表態反對使用「蒸餾」(Distillation)技術來訓練 AI 模型;他認為蒸餾雖能短期改善表現,但本質上只是在複製 Claude 等既有模型的能力,沿此路徑最多只能逼近對手,無法真正實現超越。此外,他指出程式設計(Programming)是當前的關鍵發展方向。
讀原始報導

背景

AI 蒸餾(distillation)技術在去年引發廣泛關注。當時 OpenAI 曾指控 DeepSeek 利用此技術,基於開源系統打造出強大且高效的 AI 模型。

這則事件的發展

  1. 2026-08-06字節跳動發布 SeedRealtime,據報為業界首個原生視聽全雙工大型語言模型
  2. 2026-08-02鈦媒體解析字節跳動拆分飛書:豆包需要場景,飛書需要增量
  3. 2026-07-31ByteDance整合Lark與Doubao

來源