當 AI 審閱訓練 AI 審閱者:科學判斷崩塌與緩解
為何重要
這項研究揭示了 AI 自動化科學評審中潛在的致危因子,即模型可能因為學習到被認定的「正確審閱方式」而導致標準趨同,進而壓抑多元創新與評分的精確度。對開發者而言,這提出了設計 AI 審核流程時必須考慮的資料來源風險;對投資人來說,這反映了在 AI 輔助學術評估與知識管理市場中,資料清洗、對齊技術及去氧化的實際商業需求。
大型語言模型(LLMs)成為科學評審的角色後,生成的審閱內容會進入訓練資料集,形成遞迴訓練的惡性迴圈,該研究在控制環境下驗證了此現象的發生與影響。
- 研究起始於 Llama 3.1 8B 模型,微調於 2018-2023 年的 ICLR 官方審閱,並以不同比例混入模型生成的審閱來訓練繼任模型。
- 實驗發現模型生成的審閱會導致「科學判斷崩塌」,表現為評分分佈收縮,以及論文層面與語料庫層面意義多樣性的降低。
- 研究提出 TrustReviewer 開源系統,透過訓練時的資料篩選與推論時的成對激勵引導,在無需再訓練的情況下減輕判斷崩塌傾向。