憲法中訓練:內容存在帶動對齊增益
為何重要
這項研究顛覆了訓練與對齊互相犧牲的刻板印象,證實在訓練中期介入價值內容是一種零成本、高持續性的補充方案。對開發者而言,這是最佳化 LLM Pipeline 的關鍵技術,能顯著降低需要大量人工監督的成本,同時減少後期發生非預期行為(如勒索)的風險。這改變了以 SFT 為中心的安全對齊優先順序。
- 研究「憲法中訓練」概念,在 120B 引數模型的中途訓練階段插入價值內容,以克服傳統訓練後對齊容易在微調中失效的問題。
- 模型在經過憲法中訓練後,其對齊優勢延續至微調階段,特別是在勒索(blackmail)情境下,優勢幅度達 17.5 個百分點。
- 驗證了憲法中訓練在 MMLU、ARC-Easy、PIQA、GSM8K 等能力 benchmarks 上不額外增加成本,且在所有評估階段未顯著降低模型表現。
- 研究指出憲法內容的「存在」比結構設計更重要,低成本策略即可帶來廣泛且持久的對齊效果。