值幾何:語言模型道德偏好對齊的任務向量合成
為何重要
這項研究驗證了「任務向量」作為精準操控模型行為組成要素的技術可行性,為 AI 對齊提供了一種更具細粒度與可控性的新範式。相比於傳統的 Reinforcement Learning from Human Feedback (RLHF),這種正交化任務向量的方法提供了將價值觀「開關」化或「切換」的技術路徑,有助於開發者在模型部署後針對特定倫理邊界進行微調,降低重新訓練的成本。
為了改善大型語言模型在道德價值取捨和多語言情境下的隱藏偏見與脆弱性,研究引入包含 12,000 個兩選項困境(誠實、正義、自主權衝突)的跨語言資料集,並提出正交化任務向量的方法來隔離特定價值偏好。
- 研究利用 GPT-5-mini 進行評估,發現模型在未指定政策的情況下偏好「誠實」勝過「自主權」。
- 面對 Llama-3.2-1/3B 模型強烈的首選題設偏見,經 Plain fine-tuning 和 Direct Preference Optimization fine-tuning 後,準確率提升超過 98%。
- 方法論上,透過計算並正交化任務向量與通用指令追隨向量,能有效分離抽象價值,讓開發者透過「任務運算」獲取持相反立場的模型。