研究與評測
論文提出 TTPO 測試時策略最佳化,實現無標籤數學推理訓練,Qwen3-1.7B 準確率升至 45.2%
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
新論文提出測試時策略最佳化(TTPO)框架,透過非對稱目標實現無標籤的數學推理測試時訓練(TTT)。傳統依賴多數決偽標籤的方法容易因錯誤投票誤導模型,TTPO 觀察到與偽標籤不一致的輸出通常是錯誤的,因此採用非對稱設計:對一致的輸出進行 OPSD(同策略自我蒸餾),對不一致的輸出則透過分組強化學習(Grouped RL)進行懲罰。該方法進一步在 Token 層級進行篩選,蒸餾時降低已收斂位置的權重,強化學習則僅懲罰具備高信心的錯誤。實驗顯示,TTPO 在完全無標籤的情況下,於五項競賽級基準測試中追平了有標籤監督的 OPSD 表現;在 TTT 測試中將 Qwen3-1.7B 的準確率從 38.0% 提升至 45.2%,並在無思考(without thinking)模式下帶來 25.2% 至 36.4% 的顯著提升。
讀原始報導背景
測試時訓練(Test-Time Training, TTT)是一種在推論階段調整模型部分權重以適應上下文的技術。而同策略自我蒸餾(On-Policy Self-Distillation, OPSD)則允許具備一定能力的系統,在不完全依賴外部監督的情況下進行自我完善。