跳到主要內容
2026-09-10 日報
研究與評測

推理引導實驗:Qwen3.8 注入 GPT-5.5 Pro 推理後答案重疊度大增 18.18%,暗示潛在訓練關聯

Hacker News一手來源
已查原文 · 2 項主張

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

根據原作者發布的 GitHub Gist 實驗結果,報導中所提及的各項數據與分析結論均能獲得原文支持。實驗確實顯示 Qwen3.8 在注入 GPT-5.5 Pro 提示後答案重疊度大幅提升,進而推論其潛在的訓練關聯;而 Kimi K3、DeepSeek V4 Flash 與 Inkling 等其他模型的重疊度變化也與原文數據完全吻合。

實驗測量目標模型前 100 個 token 與 GPT-5.5 Pro 的重疊度。注入引導後,Qwen3.8 的重疊度增加 18.18 個百分點,STEM 類別增加 26.99 個百分點,暗示 Qwen 可能學習了 GPT-5.5 Pro。

原文數據與結論皆支持報導所述:實驗針對前 100 個 token 測量重疊度,Qwen3.8 確實增加 18.18 百分點(STEM 增加 26.99 百分點),且作者推測這暗示其可能使用了 GPT-5.5 Pro 進行學習。

100 tokens

查看原始出處

+18.18 pp

查看原始出處

+26.99 pp

查看原始出處

learned from GPT-5.5 Pro

查看原始出處

在其他模型方面,Kimi K3 保持最高重疊度,DeepSeek V4 Flash 注入後重疊度微降 1.17 個百分點,Inkling 微升 0.46 個百分點。

原文明確指出 Kimi K3 擁有最高重疊度,且 DeepSeek 與 Inkling 的變化幅度與報導完全一致。

highest overlap

查看原始出處

−1.17 pp

查看原始出處

+0.46 pp

查看原始出處
一項針對模型的推理引導(reasoning prefills)實驗顯示,將 GPT-5.5 Pro 的推理過程注入 Qwen3.8 A95B 後,其生成答案與 GPT-5.5 Pro 的重疊度大幅提升。實驗針對 45 個問題(包含 15 題 STEM、15 題非 STEM 與 15 題合成謎題),將 GPT-5.5 Pro 推理過程的前 1% 插入目標模型的推理通道,並測量目標模型前 100 個 token 與 GPT-5.5 Pro 可見答案的重疊度。 測試結果顯示,Qwen3.8 A95B 的重疊度從無引導的 16.79% 躍升至 34.97%(增加 18.18 個百分點)。其中 STEM 類別受影響最深,重疊度增加 26.99 個百分點;私有合成謎題亦增加 14.75 個百分點。作者指出,Qwen 在先前的實驗中並未向 Opus 4.8 靠攏,此次結果暗示 Qwen 可能使用了 GPT-5.5 Pro 或相關模型進行學習。 在其他模型方面,Kimi K3 在無引導(31.11%)與有引導(35.65%)的情況下,皆與 GPT-5.5 Pro 保持最高的重疊度,引導僅帶來 4.54 個百分點的提升。DeepSeek V4 Flash 注入引導後重疊度微降 1.17 個百分點至 26.13%,Inkling 則微升 0.46 個百分點至 20.45%。
讀原始報導

背景

先前的研究曾探討從專有模型 API 擷取推論軌跡,並嘗試將 Opus 4.8 的推論片段預填(prefill)至 Kimi K3 等模型中,以觀察其輸出風格的變化。本次實驗為該系列測試的後續,改以 GPT-5.5 Pro 作為教師模型,藉由比對輸出內容的重疊度,來評估各目標模型是否曾學習過特定模型的資料。

社群討論

實驗發現 Qwen 3.8 在輸入 GPT-5.5 Pro 的 1% 推理前綴 (prefill) 後,表現向其偏移了 +20.58 分,社群指出這是透過將加密 CoT 重新注入模型解密而來。部分網友認為這證實中國實驗室依賴蒸餾且落後前沿逾一年,但也有人質疑這僅是因兩者訓練於同基準解答,或 Qwen 訓練時看過 8 月公開的被盜提示詞。此外,許多人抨擊前沿大廠抗議模型被抄襲是雙重標準,並有開發者正實測用此技巧提升 4B Qwen 等本地開源模型的效能。

這則事件的發展

  1. 2026-09-05Minima 釋出全 NVFP4 W4A4 量化版 Qwen3.8-27B,打破混合架構限制,體積縮至 17.5 GiB 且效能持平 BF16
  2. 2026-09-03Cerebras 上線 Qwen 3.8 27B 模型,據報推論速度達 1500 tokens/s
  3. 2026-09-02Qwen 發表 Qwen3.8-Flash-Next 125B MoE 架構:訓練 FLOPs 降至 1/9,結合 Gated DeltaNet 與稀疏注意力

來源

本期分類