β-OPSD:策略最佳化推導與自擴散訓練
為何重要
該研究為 LLM 訓練提供了一條新的技術路徑,透過引數化(β)調整在「自擴散的效率」與「策略最佳化的導航性」之間取得平衡,可能降低未來模型後端最佳化的工程複雜度。 對於開發者而言,這似乎是一種更穩定的自監督或 RLHF 變體設計。對產業來說,這顯示即便不採用昂貴的 RL 算行,透過巧妙的架構改裝仍能顯著提升推理能力。 對投資人而言,這代表最佳化成本的邊際趣遞減可能會被技術創新延後,側重於後端訓練效率的玩家可能受惠。
Vanilla OPSD 模型是政策最佳化家族中 β=1 的成員,研究揭示透過將 β 從隱式值轉化為可控的正則化引數,可解決其在實務應用中的可靠性和工程門檻問題,並透過介於參考政策與受權利師之間的幾何插值來訓練模型。
研究者將 RL 目標的閉式解變成知識擴散目標,透過混合兩者的 token-level logits 來高效近似昂貴的直接最佳化,並利用 return-to-go credit assignment 將 token 更新與序列目標對齊。
在數學推理基準的測試中,β-OPSD 持續優於 vanilla OPSD。