ActReview:基於回應指導的可執行同儕審查生成框架
為何重要
此研究展現了 LLM 在特定複雜情境下(如學術審核)的強大推理與指令生成能力,解決了單純生成式模型難以提供具體可執行建議的難題。雖然技術精準度仍有改進空間,但這類針對高價值應用場景的微調範例,為垂直領域 Agent 的開發提供了進一步的技術路徑參考。
- 將同儕審查拆解為診斷性斷言生成與修訂建議生成兩個子任務,強調從發現問題到提供解決方案的端到端能力。
- 建立名為 ActReview-40K 的資料集,利用 OpenReview 上的真實審核回應筆串,將作者的回應作為潛在監督訊號。
- 以 Qwen3-8B-Base 為底座,結合多工監督微調 (SFT) 與 GRPO 策略最佳化,並引入候選人感知及弱點特定的標準獎勵。
- 發布 ActReview-Bench 基準,包含 1,000 個經人類策展的例項,顯示模型在行動力與落地性上優於專門的審查生成模型,且能夠泛化至新論文。