GRPO
5 則報導橫跨 5 期2026-08-08 起
2026-09-17Hacker News
開發者以 SFT 與 RL 訓練 4B 模型最佳化 Postgres 查詢計畫,113 個複雜查詢延遲降低 44.7%
2026-08-29HF Daily Papers
研究指演化策略(ES)在 LLM 推理後訓練具更廣覆蓋率,能解決 GRPO 熵崩潰並提升 Pass@K
2026-08-27HF Daily Papers
研究提出 BPCO 強化學習方法,單一回應採樣即可達到 GRPO 效能
2026-08-13X @Xianbao_QIAN
開源語音模型 IndexTTS 2.5 發布:推論加速 2.28 倍,支援中英日等五語零樣本情感轉移
2026-08-08X @PrimeIntellect