ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

重訪大型語言模型後訓練中的完整推理軌跡

研究 1 個來源 · 13 天前
為何重要

此發現挑戰了模型開發中收集長篇、複雜思考鏈的慣例,指出最佳化策略應轉向聚焦關鍵端點而非完整過程,從而降低資料儲存與處理成本。 對開發者而言,這意味著在設計訓練資料時可以更靈活,不必過度依賴完整的輸出,減輕長 Context Window 的壓力。 從產業角度看,這為追求高效率推理模型的開發者提供了資料清洗與微調的新思路。

研究指出,現有的 LLM 訓練通常依賴收集冗長且包含繞路的推理軌跡,但實驗發現完整路徑對監督微調 (SFT) 的效益有限。 如果僅使用路徑的結尾端點進行訓練,或對軌跡進行大量截斷,仍能維持甚至提升推理表現。 分析研究顯示,推理過程中的中間 token 對最終推理品質的貢獻極小,模型具備在處理冗餘資訊時自行推斷遺漏步驟的能力。

Reasoning TracesPost-TrainingNaver AIEfficiencySFTRedundancy

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00