Qwen 跟隨 GPT-5.5 Pro 推理 Prefill 行為並顯著提升
為何重要
這項測試量化了透過「預填充推理導引」強迫開源模型模閉源前輩模型(GPT 系列特徵)的能力。結果指出開源模型透過接收到類似教師的提示,大幅模仿前端推理行為的潛力,顯示 Qwen 在對齊關鍵推理變數上相當敏感,這對競爭模型走向高度模擬化帶來警示。
- 實驗將 GPT-5.5 Pro 的前 1% 推理內容插入目標模型作為「推理預填充(reasoning prefill)」,並測量目標模型回答中前 100 tokens 的可見答案與老師答案的重疊率(依據 unigram、bigram 及 trigram 來源回憶率評估)。
- 本次實驗涵蓋 45 個難題樣本,分為 STEM、非 STEM 與合成謎題三類。
- Qwen 的表現相比早前針對 Opus 4.8 的實驗,向 GPT-5.5 Pro 提升約 18.18 個百分點,在合成謎題上成效尤大。資料顯示 Qwen 可能是從緊鄰的 GPT 模型或 GPT-5.5 Pro 本身學習的特性,而非 Opus 4.8。
- Kimi K3 在無預填充情況下與 GPT-5.5 Pro 的重疊度已達最高值 35.65%,開啟推理僅進一步增加 4.54 個百分點。