SLPO:利用代理策略縮放潛在推理
為何重要
SLPO 這類技術解決了潛在推理模型長期以來無法利用 rloo 等 outcome reward 方法進行視覺化最佳化的痛點,填補了從 Explicit CoT 到 Latent Reasoning 的工具鏈空白。對開發者而言,這意味著未來在追求高效率和低成本的推理系統時,不再只能二選一,而是透過 SLPO 等方法挖掘連續向量空間中更潛在的 scaling potential。
目前大多數基礎模型倚賴可驗證獎勵的強化學習來達成 test-time scaling,但明確的 Chain-of-Thought (CoT) 推理因每步需解碼 Token,計算成本高居不下。相對地,潛在推理雖以向量表示且效率較高,卻長期受限於「模仿學習」,且因缺乏可解釋性與停止介面,無法透過 outcome rewards 最佳化。研究團隊提出 SLPO (Surrogate Latent Policy Optimization),首次將 outcome-reward RL 引入自回歸潛在推理器,利用軌跡層級信用分配與正確性監督的停止頭,讓模型具備動態長度的測試時擴充套件能力。
- 方法架構:SLPO 透過經驗 surrogate policy density 進行軌跡信用分配,並引入正確性監督的停止頭,將 outcome rewards 最佳化為具備可變長度的策略。
- 效能改善:實驗證實 SLPO 在平行取樣測試下提升了 Pass@k,且能將較長的潛在計算分配給較難的範例以獲得更高決定性準確率。
- 能力突破:證明瞭潛在推理具備可最佳化性,打破了其僅能依賴模仿學習的瓶頸,使其未來發展路徑與 Explicit CoT 類似。