研究與評測
Apple 提出擴散語言模型強化學習方法 DACA-GRPO,約束滿足與程式碼生成最高提升 36.3pp 與 7.4pp
Apple ML一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Apple ML 發表論文提出 DACA-GRPO(Denoising-Aware Credit Assignment for GRPO),旨在改善擴散語言模型(Diffusion Language Models)中的強化學習。研究指出,現有擴散模型的 RL 方法將所有去噪步驟視為同等重要,缺乏跨去噪軌跡的時間信用分配,且策略最佳化所用的平均場似然估計存在系統性偏差。
DACA-GRPO 作為輕量級、隨插即用的增強模組,適用於任何 GRPO 風格的訓練器,並引入兩項核心機制:第一是「去噪進度分數(Denoising Progress Scores)」,可從中間預測中提取每個 token 的重要性權重,且不增加額外的 forward 成本;第二是「分層遮罩似然(Stratified Masking Likelihood)」,透過將 token 位置分層,使每個 token 預測時能以大部分序列為上下文,藉此減少平均場偏差。
實測顯示,將 DACA-GRPO 應用於三種 GRPO 基礎方法上,在七個基準測試中皆取得一致提升。具體增幅包含:數學推理最高提升 5.6pp、程式碼生成提升 7.4pp、約束滿足(constraint satisfaction)大幅提升 36.3pp,以及 JSON schema 遵循提升 5.9pp。
讀原始報導背景
目前多數大型語言模型皆基於自迴歸(autoregressive)架構,但近期學界與業界開始積極探索擴散模型(Diffusion)在語言生成的應用。例如 Google DeepMind 的 Gemini Diffusion 與開源模型 LLaDA 等,皆試圖利用擴散技術來提升文本生成的控制力與速度。
來源
本期分類
相關主題