推出 ExplorationBench:測量 AI 系統在可驗證外星世界中的發現能力
為何重要
這項基準測試打破了 AI 目前仰賴預訓練資料檢索表現的慣例,轉向評估 AI 在全新環境下的學習與泛化能力。對於目標是自動化研發的企業來說,能否將從 sandbox 中習得的規則體系,泛化到真實世界的問題解決上,將決定 AI 是否具備獨立創新的核心價值。目前系統在不同探索路徑上的不穩定性,也標示出通往通用「探索智慧」仍需克服動態調整與知識遷移的技術難關。
為了評估 AI 系統在未知環境中自主進行假設驗證與科學探索的能力,研究團隊建構了 ExplorationBench 框架。該框架利用「外星世界」作為 sandbox,其規則可執行且與既有知識衝突,可用來區分系統是透過探索還是單純回憶資料來解題。Benchmark 包含 AlienCode 與 AlienLogic 兩個 sandbox,前者有 31 個發現目標與 70 個任務,後者則有 24 個發現目標與 70 個任務。研究評估了 10 個 AI 系統,發現表現最優者雖然能獲取並套用陌生規則,但持續探索可能導致效率衰退或倒退。