研究與評測
Apple 發表強化學習方法 RLTL;DR:透過自我生成反饋,使 Qwen 3.5 9B 在高難度任務 Pass@1 突破 12%
Apple ML一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Apple 機器學習團隊發表名為 RLTL;DR 的強化學習新方法,旨在解決模型在缺乏教師模型且任務難度極高(成功率極低或為零)時的自我改善瓶頸。該方法在模型每次嘗試失敗後,會讓策略模型根據驗證器輸出寫下一段「TL;DR」簡短洞察作為自我反饋,並將其用於下一次生成的條件限制,同時透過反向傳播內化「任務到洞察」的直接映射關係。
研究團隊在過濾至 Pass@128 = 0 的高難度工具呼叫與程式碼資料集上進行測試。數據顯示,標準 GRPO 訓練下的 Qwen 3.5 9B Thinking 模型 Pass@1 僅 0% 至 1%;採用 RLTL;DR 後,模型在訓練時包含上下文洞察的 Pass@1 達 14% 至 31%,而在評估時(無上下文洞察)的 Pass@1 成功率也突破至 12% 到 13%。
研究進一步指出「任務到洞察」的內化是關鍵,並簡化出 SFTL;DR 方法。實驗證明,僅需 4,000 筆「任務與洞察」配對資料進行訓練,在不依賴完整生成過程與反向傳播的情況下,即可幾乎恢復 RLTL;DR 與傳統 SFT 的完整效能。
讀原始報導