ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

onPanda:透過 Token 級修正高效標註 LLM 與 Agent 的 On-Policy 對齊資料

研究 1 個來源 · 1 天前
為何重要

資料構建對於 aligning agent 軌跡至關重要,而傳統標註成本高昂且程式繁瑣。onPanda 提供的 Token 級精準修正機制大幅縮減了人力成本並確保資料分佈特性,這對於需要強化 Agent 運作穩定度的開發者與業者具有重要的實戰意義,亦可能改變未來資料產業的評量標準。

研究團隊推出名為「onPanda」的互動式工具,旨在高效標註大型語言模型(LLM)和專屬代理的對齊資料與軌跡。

  • 工具採用 Token 級別修正為核心機制:標註者只需找出第一批不當 token 並進行替換或修訂,系統隨即根據修正後的字首重新生成。
  • 研究顯示,使用 onPanda 的標註中位數時間比傳統手動後編輯減少 52%。
  • 該方法生成的資料極致保留了模型的取樣分佈(因多數 token 源於模型自身生成),非常適合用於構建 On-Policy 的 SFT 與偏好資料。
  • 研究團隊還同步釋出了使用 onPanda 標註的「Panda-CVL」資料集及其對應的 Token 級修正基準。
onPandaLLMAgentData AnnotationAlignment

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00