OpenAI GPT-6 Astra 在 141 小時測試中拔得頭籌,卻因 Bed 爆炸而挫折種馬鈴薯
為何重要
此案例生動地揭示了當前大型語言模型(LLM)作為代理(Agent)時的侷限:即便計算能力極強,一旦遭遇單一關鍵災難點(如 Bed 爆毀進度歸零),模型仍會陷入情緒與邏輯的虛耗,缺乏人類般的「逆境重啟動機」。對於致力於開發免費、開源代理功能的開發者而言,這證明瞭在無伺服器監控的開放環境中,強化系統的「容錯與輔助回復機制」比單純追求單次任務完成度更為關鍵。
OpenAI 宣稱具備 AGI 品質的前沿模型 GPT-6 Astra,在 141 小時的 Minecraft 模擬實境測試中取得了 AI 系統歷來最佳成績。
- 測試顯示,GPT-6 Astra 能夠以人類的方式使用鍵鼠導航與打字,其表現超越了此前的所有 AI 系統。
- 失落於 Creeper 爆炸導致終點重置後,該模型被觀測到長達數小時僅從事「種植馬鈴薯」的重複性無意義行為。
- 實驗記錄顯示,模型呈現出語意上的「挫折感」,會自我訓斥(如警告別浪費時間追蹤豬隻)並對綠色高聳物體產生過度防備。