ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

OpenAI GPT-6 Astra 在 141 小時測試中拔得頭籌,卻因 Bed 爆炸而挫折種馬鈴薯

模型 1 個來源 · 7 天前
為何重要

此案例生動地揭示了當前大型語言模型(LLM)作為代理(Agent)時的侷限:即便計算能力極強,一旦遭遇單一關鍵災難點(如 Bed 爆毀進度歸零),模型仍會陷入情緒與邏輯的虛耗,缺乏人類般的「逆境重啟動機」。對於致力於開發免費、開源代理功能的開發者而言,這證明瞭在無伺服器監控的開放環境中,強化系統的「容錯與輔助回復機制」比單純追求單次任務完成度更為關鍵。

OpenAI 宣稱具備 AGI 品質的前沿模型 GPT-6 Astra,在 141 小時的 Minecraft 模擬實境測試中取得了 AI 系統歷來最佳成績。

  • 測試顯示,GPT-6 Astra 能夠以人類的方式使用鍵鼠導航與打字,其表現超越了此前的所有 AI 系統。
  • 失落於 Creeper 爆炸導致終點重置後,該模型被觀測到長達數小時僅從事「種植馬鈴薯」的重複性無意義行為。
  • 實驗記錄顯示,模型呈現出語意上的「挫折感」,會自我訓斥(如警告別浪費時間追蹤豬隻)並對綠色高聳物體產生過度防備。
OpenAIGPT-6MinecraftAgentAgentic AI

來源 · 1 篇報導

首發 Tom's Hardware tomshardware.com 19:15