ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

VDiff-Bench:細緻影像差異識別的挑戰性基準

研究 1 個來源 · 13 天前
為何重要

VDiff-Bench 揭示了當前商業與開源模型在「變化偵測」這項精細能力上的顯著落差,這比單純的視覺問答更能反映模型底層邏輯的穩定性。對開發者而言,直接套用現有 MLLM 進行影像版權查核、受損修復比對或質量檢驗時,必須特別小心模型可能會把低階變化(如新增噪點或文字)誤判為「無變化」的幻覺現象。對產業投資而言,這意味著通用型霸權並未完全形成,擁有細緻多樣化訓練資料的亮眼開源模型,在劍指需要精密邏輯判斷的垂直應用場景時,具備了比商業封閉模型更高價效比的潛力。

多模態大型語言模型(MLLMs)在一般視覺任務上表現強勁,但在比對兩張相似圖片的細緻變化時仍舊面臨嚴重挑戰。為了診斷這一盲點,研究團隊提出了 VDiff-Bench 基準,專門評估模型從路徑變化到紋理噪聲等 10 種具體差異的識別能力。

  • 基準包含 1,756 個多選題,每題配對兩張圖片與 4 個選項,涵蓋位置、運動、區域/整體顏色、appearance/disappearance、噪聲/解析度、紋理、substitution/size、OCR 文字、lighting 等 10 種類別。
  • 實測顯示,即使是先進模型在這類比較任務上依然脆弱,表現極度不均:2 個 7-8B 規模的開源 MLLM 在識別「區域顏色」等 semantic changes 時準確率高達 52.5-70.6%,但在「噪聲」或「紋理」這類低階變化上只有 8.7-33.3%。
  • 令人意外的是,具備強大效能的閉源模型 Grok 4.3 在辨識圖片間的噪聲與紋理差異時表現大幅衰退,甚至落後於 Kimi K2.5 和 K3 等大型開源模型。
VDiff-BenchMLLMBenchmark精緻影像辨識NoiseTexture

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00