OpenAI 訓練員因「使用 AI 製作 AI」而遭開除,揭露 RLHF 與人為監管的悖論
為何重要
此事件突顯了大模型訓練執行面的「檢測悖論」與「Model Collapse」風險:當審查人員在面臨效率與成本壓力下轉向 AI 工具,可能導致回饋品質惡化甚至被刻意破壞,從而削弱模型訓練基準。這對產業而言意味著 RLHF(人類回饋強化學習)鏈條的信用度正在下降,企業急需投資更智慧的反 AI 監測成本,否則模型實際效能可能遠低於預期。投資人需將「人為註解與審查的品質風控」視為評估模型底層資產的重要負債專案。
404 Media 報導調查顯示,負責審查 ChatGPT 使用者對話以改善模型的委外承包商,因在工作中使用 Grammarly 或 AI 翻譯協助而被解僱;這與 Mercor 等訓練公司契約中明確禁止員工使用 LLM 的規定相悖。