OpenAI 透過 Project Lily 計畫僱用數百人類承包商審查對話,揭示資料訓練仍需人為介入
為何重要
這項重大揭露粉碎了 AI 公司僅靠演算法與大數據就能提升模型品質的迷思,證實了「產品化最後一哩」(human-in-the-loop)仍是矽谷巨頭數年的核心競爭力。對開發者而言,這強化了模型即將面臨的「AI-speak」與合規風險;對投資人來說,這證明瞭 AI 業務模型極度依賴昂貴的人力資源與客戶隱私合規管理,非單純的硬體支出所能支撐。
404 Media 報導指出,OpenAI 正以「Project Lily」為名僱用數百名承包商閱覽匿名的真實 ChatGPT 對話,評估模型回應是否過度使用「AI-speak」、奉承擬人化或說教語氣。這意謂著模型最佳化不再僅仰賴演算法技術,人工標註仍是維持回應自然度與品質的關鍵環節。
- 專案中的審查員(prompt reviewers)時薪超過 50 美元,主要負責刪除回應中的擬人化表達及聲稱私人經驗的內容。
- 匿名化篩選並非萬能,短對話或變體仍可能殘留個人資料,且審查工具中含有使用者記憶摘要(可能包含位置)。
- 雖多數消費版bot預設允許使用對話改善產品,但該設定在企業版預設為關閉,且無法撤銷既有資料庫中對話的讀取許可權。