ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Poplar:用於人類中心影像資料集合成的可擴充套件流程

工具 1 個來源 · 2 天前
為何重要

對於訓練視覺語言模型 或開發 Generative AI Agents 的團隊而言,資料集的品質與多樣性是關鍵瓶頸。Poplar 提供了從單圖生成邁向工程化資料庫合成的解法,不僅標準化了品控流程,也大幅降低了建立高品質訓練素材的隱性成本,有助加速產品在多樣化場景下的開發迭代。

儘管現有 AI 影像生成器具備單張圖片的生成能力,但要構建具有多樣性、符合攝影質感且能滿足資料庫規模的「人類中心」資料集仍為一大挑戰。研究團隊提出名為 Poplar 的可重現性流程,透過 Specify、Render 與 Inspect 三階段,將結構化屬性轉為攝影提示、以生成器重試失敗並進行結構化審查,解決大規模資料集合成中的品控難題。

  • 管道運作分為 Specify(依常識約束樣本並轉為攝影導向提示)、Render(使用寫實生成模型並重試技術性失敗)與 Inspect(以結構化視覺語言審查缺陷與提示詞不符)三個步驟。
  • 該流程成功產出名為 Poplar-9K 的資料集,包含 9,401 組經人類篩選的「影像-文字」配對,源自 11,765 個候選圖,整體保留率為 79.9%。
  • 作者完整釋出執行管道、配置檔、不可變的生成提示詞以及可稽核的審查記錄,作為建構客製化人類中心資料集的複用資源。
PoplarSynthetic DataDatasetVision-LanguagePipelineHugging Face

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00