ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

WhatWorkedBench:AI 智慧體實驗理解能力測 Benchmark

研究 1 個來源 · 1 小時前
為何重要

- 傳統 Benchmarks 多偏重「結果準確度」(Run performance),WhatWorkedBench 則評估「過程理解與預測」,這是硬體、演算法調參等領域極度重視但較難量化的能力。 - 對開發者而言,具備精確預測變更效果能力的智慧體,能大幅節省試錯成本,促進自動化實驗設計(Adaptive Experimental Design)的普及。 - 此成果顯示 AI 正從單純執行轉向模擬與推論,若 DeepMind 或其他大廠在「理解實驗因果」的指標上領先,將影響日後 Research Agent 產品商業化的技術想像空間。

  • WhatWorkedBench 是一個測量 AI 智慧體「實驗理解」能力的 Benchmark,核心評估其對預算內元件變更結果的預測準確性,要求智慧體檢查程式碼並提交預測各配置分數的回應曲面。
  • 評測池包含來自 30 個資料來源的 36 個任務、8 種工作流程型別,共 1,248 組配置記錄,核心評估指標涵蓋 4,206 個數值控制記錄。
  • 在原始 Flash 組評估中,高斯過程(GP)擬合觀察值可將效能恢復率從 0.632 提升至 0.698,雙重效應脊選擇器在 22 個來源中達成 15 個最佳解的選擇。
  • 透過編碼程式碼等價性並重新測量,GP 將 6 個二選一選項的工作流程恢復率從 0.248 顯著提升至 0.462。
WhatWorkedBenchAI AgentsBenchmarkAdaptive Experimental DesignHugging FaceGaussian Process

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00