ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

開啟兩項 API 設定最佳化 GPT‑5.6 Sol 在 ARC-AGI-3 的表現

模型 1 個來源 · 3 天前
為何重要

這揭示評估工具的設計方式(如 Harness 選擇)對結果毀滅性影響,單靠模型架構無法保證 Agent 在動態環境中的表現。OpenAI 的建議標誌著 API 層面最佳化正成為模型可行性的關鍵,開發者應優先考慮統一生產環境導致的高效能潛力。

OpenAI 發現 GPT‑5.6 Sol 在 ARC-AGI-3 benchmark 的低分顯然受制於通用 Harness 導致的記憶丟失與訊息移除問題。這項 benchmark 是為測試 AI 敏銳度與推論能力,但未必銜接實際應用場景。透過啟用 Responses API 的「保留推理」與「壓縮」功能,模型能持久記住過往策略,不僅通關全部 6 關,輸出代幣數量還縮減 6 倍。

  • 解析:GPT‑5.6 Sol 原本僅得 7.8% 分數,<GPT‑5.5 甚至只能達到 0.4%>。啟用新設定後能通過全部 6 個 ARC-AGI-3 水平,表現約為原本的三倍。
  • 效能:透過保留推理訊息與啟用壓縮(Compaction),模型不再需每回合重新推導遊戲規則,輸出 token 數量大幅縮減 6 倍。
  • 原因:原測試的通用 harness 採用滾動截斷並移除推理歷史,導致模型無法記住過去思考或行動,而新版 harness 追蹤了這些關鍵資訊。
GPT‑5.6 SolARC-AGI-3OpenAIResponses APIBenchmark

來源 · 1 篇報導

首發 OpenAI News openai.com 23:00