知曉何時該停止:段層信用指派以減少「過度思考」
為何重要
對於依賴長上下文與高強度推理的應用(如 Coding Agent、資料分析師),降低「Overthinking」是突破延遲瓶頸與降低 Token 成本而非僅擴充引數規模的核心路徑。此研究標示出往「推理效率最佳化」發展的技術趨勢,未來平臺競爭將不只比拼模型能力,更比拼降低推理溢價的演算法創新。
推理模型常因產生未具產能的自我反思而浪費資源,即便在控制回應長度的情況下,不正確的推理軌跡仍含有較高比率的無效自我反思。本研究提出 DASH 方法,利用中間答案作為低成本代理,避免昂貴的步驟層級標註。
- 提出的演算法名稱為 DASH(Drift Aware advantage SHaping),其依據推理片段是朝向或偏離正確性來分配段層信用。
- 在競賽級數學基準測試上,DASH 實現了 59.45% 的平均準確率,顯著優於 Dr.GRPO 的 58.1% 與 GRPO 的 56.95%。
- 該方法有效識別並限制了導致效能沈潛的延續性思考行為,提升了自我修正的生產力。