PLC-DPO:噪聲與歧義偏好最佳化中的後驗標籤修正
為何重要
傳統 DPO 在訓練語言模型對齊時極易受不實標籤幹擾,導致模型輸出行為失真。PLC-DPO 為此提供了數學理論與實務良好的對策,讓開發者在處理 noisy human feedback 時,能以更高的確定性生產符合預期的模型行為,減少無謂的標註反覆修正。對追求模型穩定性的產業研發而言,這是提升 RLHF 實戰效能的有效工具。
Direct Preference Optimization (DPO) 雖簡化了對齊流程,但前提是偏好標籤必須可靠,現實資料常違反此假設。本研究提出 PLC-DPO,將噪聲偏好學習視為主動校正監督方向,而非單純過濾範例。
- PLC-DPO 利用校正後的政策–參考邊際作為線上證據,將訓練訊號路由為乾淨、翻轉或平局等不同情形。
- 在 57 個資料集–模型–基準組合測試中,PLC-DPO 平均勝率(60.5%)比第二好的方法高出 5 個百分點。
- 包含注入噪聲、平局壓力測試及人類分歧分析在內的額外測試,均證實該路由機制能穩定區分翻轉與弱方向對。