ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

GameHorizon 套件:跨時長視角的遊戲資料與評估方案

研究 1 個來源 · 1 天前
為何重要

這項工作填補了遊戲場景中缺乏長程規劃能力標準化評估的空白,為具備 Agent 能力的模型提供了更嚴謹的測量工具。對產業而言,這種標準化有助於加速優秀邏輯推理模型的商業化驗證;對研究則提供了廣泛的可重現資料基礎。

現代電玩結合了視覺理解、指令分解與目標規劃,是測試 AI 行為能力的關鍵場景,但現有資料集常受限於遊戲型別或缺乏語言指令。為解決此問題,研究團隊推出了 GameHorizon 套件,提供衡量不同時間視角遊戲能力的統一資料與評估方案。

  • 套件包含三個元件:GameHorizon-Annotator(具備自動註解管線)、含 5000 小時錄影與 21 款遊戲的 GameHorizon-Data(由 100 名專家玩家建立),以及進行可重現評估的 GameHorizon-Bench。
  • 評估涵蓋了 47 個模型超過 100 萬次的呼叫,透過離線軌道的標準化問題與線上軌道的逐步測試,揭示不同模型間的能力差異並定位長羅輯鏈遊戲中的失敗步驟。
GameHorizonBenchmarkAI ResearchGamingAgent

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00