GPT 模型中的「危害洗錢」:安全訓練世代間性別歧視的轉化非消除
為何重要
這項研究對照傳統指標(如 Detoxify)與新指標(如 REGARD)的差異,證明單一毒理化學習器的「指標下降」並非安全完善的保證,反而可能伴隨著隱性偏見的擴散;AI 研發者與安全工程師必須杜絕對單一分類器的盲目依賴,轉而監控更細緻的「歧義性質」與「代表性行為」損害。
現行大語言模型安全評估基於表面分類器,系統性評估方法存在盲點,導致明確的歧視性內容從文字表面被「洗掉」後轉化為隱晦形式。
- 研究分析了 15 款從 GPT-2 到 GPT-5 的模型(OpenAI 線系)、45 萬筆性別導向輸出,發現女性導向輸出的性暴力內容在 GPT-4 後消失,男性導向輸出卻佔領了照護、情感及盟友等正面領域。
- GPT-5 出現 1,997 份檔案將乳癌框架為男權辯論,而女性導向輸出中完全沒有對應主題,且三名獨立分類器皆評分為非毒性。
- 統計顯示到 GPT-4 對齊邊界時,女性導向輸出的主題多樣性相較男性下降了 36%(W/M 比值從 0.91 跌至 0.58),且 REGARD 表示性偏見隨版本演進而顯著增加。