研究與評測
Latent Space 分析 AI 訓練管線演進:合成與模擬技術接管研發,成本降百倍且速度快萬倍
Latent Space單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Latent Space 報導,AI 訓練管線正全面從人工轉向模型生成的合成與模擬,此轉變雖可能使品質下降 10%,但能讓成本降低 100 倍、速度提升 10000 倍。該分析將此演進分為七個階段。
在輸入合成方面,2022 年獎勵訊號率先合成化,如 Anthropic 於 2022 年 12 月 15 日發表 Constitutional AI 論文,透過 AI 回饋訓練無害助理,隨後 LLM-as-judge 成為預設評測方法。2023 年,微軟 Phi 系列與 Apple 的 WRAP(重新生成網頁使預訓練效率提升 3 倍)確立了合成訓練資料的地位;同年 Stanford Alpaca 與後續的 DeepSeek-R1 則確立了以模型作為教師進行蒸餾的標準。
在閉環與自動化方面,2024 年 Meta 的 Self-Rewarding Language Models 讓模型開始自行設計學習課程。報導進一步指出 2025 至 2026 年的發展:Karpathy 於 2026 年 3 月展示自動研究迴圈,透過程式代理修改 LLM 訓練設定並徹夜執行 700 次實驗,將 time-to-GPT-2 從 2.02 小時縮短至 1.80 小時;Z.ai 的 GLM-5.3 與 Ornith-1.5 實現了端到端環境合成,由代理挖掘真實工作模式並轉換為具隱藏狀態的長效環境,評審與驗證堆疊皆為合成;而 Simile 等專案則正嘗試在 2025 年取代人類受試者,完成全管線的模擬。
讀原始報導背景
「Constitutional AI」是由 Anthropic 於 2022 年底提出的訓練方法,透過 AI 自身的回饋作為獎勵訊號,以強化學習來引導模型自我修正。這類技術與合成資料的應用,正逐漸取代傳統高度依賴人類標註的 AI 開發流程,讓模型訓練變得更自動化且高效。