推理引導實驗:Qwen3.8 注入 GPT-5.5 Pro 推理後答案重疊度大增 18.18%,暗示潛在訓練關聯
已查原文 · 2 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
根據原作者發布的 GitHub Gist 實驗結果,報導中所提及的各項數據與分析結論均能獲得原文支持。實驗確實顯示 Qwen3.8 在注入 GPT-5.5 Pro 提示後答案重疊度大幅提升,進而推論其潛在的訓練關聯;而 Kimi K3、DeepSeek V4 Flash 與 Inkling 等其他模型的重疊度變化也與原文數據完全吻合。
實驗測量目標模型前 100 個 token 與 GPT-5.5 Pro 的重疊度。注入引導後,Qwen3.8 的重疊度增加 18.18 個百分點,STEM 類別增加 26.99 個百分點,暗示 Qwen 可能學習了 GPT-5.5 Pro。
原文數據與結論皆支持報導所述:實驗針對前 100 個 token 測量重疊度,Qwen3.8 確實增加 18.18 百分點(STEM 增加 26.99 百分點),且作者推測這暗示其可能使用了 GPT-5.5 Pro 進行學習。
100 tokens
查看原始出處
+18.18 pp
查看原始出處
+26.99 pp
查看原始出處
learned from GPT-5.5 Pro
查看原始出處

背景
先前的研究曾探討從專有模型 API 擷取推論軌跡,並嘗試將 Opus 4.8 的推論片段預填(prefill)至 Kimi K3 等模型中,以觀察其輸出風格的變化。本次實驗為該系列測試的後續,改以 GPT-5.5 Pro 作為教師模型,藉由比對輸出內容的重疊度,來評估各目標模型是否曾學習過特定模型的資料。
社群討論
實驗發現 Qwen 3.8 在輸入 GPT-5.5 Pro 的 1% 推理前綴 (prefill) 後,表現向其偏移了 +20.58 分,社群指出這是透過將加密 CoT 重新注入模型解密而來。部分網友認為這證實中國實驗室依賴蒸餾且落後前沿逾一年,但也有人質疑這僅是因兩者訓練於同基準解答,或 Qwen 訓練時看過 8 月公開的被盜提示詞。此外,許多人抨擊前沿大廠抗議模型被抄襲是雙重標準,並有開發者正實測用此技巧提升 4B Qwen 等本地開源模型的效能。