GradCuit:獲取梯度流程實現穩健且可解釋的測試時間潛在推理
為何重要
此技術推動 LLM 從簡單的「輸出再生」,轉向「主動調整推理邏輯」,提供了一條無需重訓練即可提升模型穩定性的路徑。對於開發者而言,這是一種可驗證、具體的測試時擴充套件新策略;對產業而言,降低推理標準差的特性直接關乎商業部署的成本控制與可靠性。
為瞭解決現有潛在推理方法在歸因與路徑透明度上的不足,研究提出 GradCuit 演算法,透過在 Transformer 層插入可最佳化的潛在狀態,讓模型能直接利用最終結果的回饋來反向更新內部推理途徑。
- 在 5 個指令微調底層模型、3 個推理基準測試及 2 種回答格式下,平均準確率達 64.5%,優於鏈式思考法 6.6 個百分點並領先競爭對手 2.4 個百分點。
- 在 7 種不同的學習率設定下皆保持穩健表現,將標準差從 1.53 顯著降低至 0.82,顯示出更高的容錯性。
- 分析顯示,早期至中間 Transformer 層是最佳的最佳化空間,且權重梯度主要集中在推理連線詞等關鍵 token 上。