開發生態
開發者解析 MiMo-V2.6-Flash 在 vLLM 的工具調用 Bug:修復空回覆與思考過程遺失,並揭露 2048 Token 輸出限制
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit r/LocalLLaMA 社群開發者實測指出,MiMo-V2.6-Flash-RL 在 vLLM 上部署時出現的工具調用問題,實為 serving 階段的 Bug,並提出三項修復與發現。
首先,在串流模式(streaming)且開啟思考(thinking)時,多輪對話的回覆會顯示為空。原因是 vLLM 解析 prompt 時,讀到歷史訊息的 `</think>` 就誤判推理已結束,導致推理內容被當作一般文字輸出,使客戶端解析失敗;解法是在 `chat_template.jinja` 的 generation prompt 預先加上 `<think>`。
其次,模型在工具調用循環中會遺失先前的推理過程。原因是預設模板僅讀取 `reasoning_content`,而 vLLM 輸出 `reasoning` 欄位;同時 vLLM 內部也只讀取 `reasoning`,導致客戶端傳回的資料被丟棄。解法為修改模板與 vLLM 的 `chat_utils.py` 以同時支援兩種欄位。
最後,開發者揭露該模型存在隱藏的 2,048 tokens 輸出上限。
讀原始報導