ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

PLC-DPO:噪聲與歧義偏好最佳化中的後驗標籤修正

研究 1 個來源 · 9 天前
為何重要

傳統 DPO 在訓練語言模型對齊時極易受不實標籤幹擾,導致模型輸出行為失真。PLC-DPO 為此提供了數學理論與實務良好的對策,讓開發者在處理 noisy human feedback 時,能以更高的確定性生產符合預期的模型行為,減少無謂的標註反覆修正。對追求模型穩定性的產業研發而言,這是提升 RLHF 實戰效能的有效工具。

Direct Preference Optimization (DPO) 雖簡化了對齊流程,但前提是偏好標籤必須可靠,現實資料常違反此假設。本研究提出 PLC-DPO,將噪聲偏好學習視為主動校正監督方向,而非單純過濾範例。

  • PLC-DPO 利用校正後的政策–參考邊際作為線上證據,將訓練訊號路由為乾淨、翻轉或平局等不同情形。
  • 在 57 個資料集–模型–基準組合測試中,PLC-DPO 平均勝率(60.5%)比第二好的方法高出 5 個百分點。
  • 包含注入噪聲、平局壓力測試及人類分歧分析在內的額外測試,均證實該路由機制能穩定區分翻轉與弱方向對。
PLC-DPODPOAlignmentHuman FeedbackPreference Optimization

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00