公平剪枝:透過差異化激勵定位 GLU-MLP 層中的人口統計偏誤
為何重要
這項研究證實人口統計偏誤與模型的核心語言能力可能執行於「解離迴路」,支援了從機械式遮蔽轉向精確調節特定神經元以實現可控行為改變的觀點。對於開發者而言,這種極為精確的「手術」式偏誤去除概念,提供了一個在效能保留的前提下,緩解 AI 偏見的新路徑。
本項研究提出 Fairness Pruning,一種用於定位及管理大型模型人口統計偏誤的輕量級結構性幹預方法。研究結合標準化基準評測與定性文本生成實驗,利用最小對比提示對與推論時間激勵捕捉,針對 GLU 架構在 down_proj 輸入端的訊號進行因果偏誤定位。
- 實證測試涵蓋 *Llama-3.2* 家族與 *Salamandra-2B* 系列模型(引數量可達 30 億)。
- 在 *Llama-3.2-1B* 中,僅需將最多 40 個神經元歸零(總 MLP 寬度的 *0.031%* 以下),即可在推理和一般知識能力上保留 *99.49%* 的表現。
- 零化操作會改變模型對相關人口統計變數的回應,但由於 *BiasScore* 無正負號,導致候選集合中同時包含推動與反對刻板印象的神經元。