OpenAI 指出使用 Responses API harness 強化 GPT-5.6 Sol,讓 ARC-AGI-3 分數成長三倍且 Token 使用量減少
為何重要
這項發現強烈證明 harness(強化框架)與 prompt 工具對最終模型表現有決定性影響,甚至可能與模型本身權重同等重要。對於開發者來說,這意味著最佳化「如何使用」模型比抽取引數更關鍵;對於投資人,這揭示了基準測試結果的複雜性,高分未必直接對應商業化產能,需審慎解讀。
OpenAI 針對 GPT-5.6 Sol 模型進行 ARC-AGI-3 基準測試,探討 harness 工具對推演能力的影響,發現工具設定調整後表現驚人。
- 使用官方 harness 的 ARC-AGI-3 分數為 7.8%。
- 使用 Responses API harness 的 ARCH-AGI-3 分數是官方 harness 的三倍。
- 使用 Responses API harness 版本的模型消耗了較少的 tokens。