跳到主要內容
2026-09-25 日報
模型發布

FreedomIntelligence 發布醫療大模型 HuatuoGPT-3-27B,採單階段強化學習並開源資料集

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據社群消息指出,FreedomIntelligence 發布了基於 Qwen3.8-27B 的醫療大型語言模型 HuatuoGPT-3-27B。該模型採用單階段策略最佳化(One-stage Policy Optimization, OnePO)技術,無需先進行領域特定的監督式微調(SFT),即可透過單一強化學習階段讓語言模型適應醫療領域。在訓練機制上,教師模型的回應會提供暫時性指引,並隨著模型能力的提升而逐步退場。開發團隊已同步開源訓練程式碼、醫療強化學習資料集以及 8B 規模的評分模型(rubric grader);此前該團隊也於上週釋出了 9B 版本的 HuatuoGPT-3-9B。
讀原始報導