LLM 偏好對齊的新零階架構:ComPO
為何重要
ComPO 代表了模型對齊技術從傳統梯度下降向零階最佳化視角的轉變,提供了一種在理論上減少似然位移的新路徑。這對於追求長期模型行為穩定性的研究社群而言,具備重要的方法論參考價值。
針對傳統直接偏好對齊方法的潛在缺陷,研究團隊提出了 Comparison-based Preference Optimization(ComPO),這是一種基於比較判別器的零階對齊方法,旨在解決似然位移(likelihood displacement)並提高效率。
- 提出的 ComPO 方法利用比較判別器(comparison oracles)從偏好對中提取定向資訊,而不直接最佳化可微分的偏好損失。
- 理論層面建立針對離線與線上方案的收斂性與效能保證,涵蓋平穩性、梯度稀疏性及潛在目標的相容性。
- 實驗於 Mistral、Llama、Gemma-2、Qwen3、Gemma-3 等模型上進行,證明其優於現有直接對齊方法,包含長度控制的勝率。