模型發布
UkisAI 宣稱 Swift-Qwen3.8-27B:思考 Token 減少 58%、速度提升 1.95 倍
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
Reddit r/LocalLLaMA 一則未經驗證的貼文稱,UkisAI 對 Qwen 3.8 27B 進行後訓練,推出 Swift-Qwen3.8-27B;其目標不是直接縮短推理長度,而是辨識與過度思考及重複推理迴圈相關的 Token 並加以抑制。作者宣稱,該模型可減少 58% 思考 Token、提升 1.95 倍速度,且在幾乎所有其內部分布外測試中的準確率損失低於 1%。
貼文稱,團隊使用 8 張 H100 產生涵蓋程式設計、語言、視覺與代理任務的推理軌跡,辨識過度思考樣本中的共同 Token,再以 LoRA SFT 等方式訓練;團隊也曾測試 RL(GSPO)、On-Policy Distillation 與 ThinkingCap 3.6 27B adapter 片段,以恢復降低推理量後的準確率。作者表示,為取得可靠分數,每項基準測試執行 10 次,分別包含基礎模型與其 adapter,但貼文提供的材料未列出各項基準的具體分數。
模型已由作者放上 Hugging Face,並提供 Q1 至 Q8 的 GGUF 版本;貼文另提到社群製作了 NVFP4、W4A16、未審查版及其他不同精度的量化版本。UkisAI 也稱提供免費研究用途 API,採 OpenAI 相容介面,獲 NVIDIA 提供 GPU,使用限制為每分鐘 5 次請求。
作者強調,這套方法不是 reasoning effort 設定、聊天模板或 Token 上限的替代方案,而是針對過度思考的獨立處理方式。上述模型、速度、準確率與訓練結果目前僅來自 Reddit 單一貼文,沒有其他佐證來源,尚未獲獨立驗證。
讀原始報導