兩款前沿模型角逐 Physical AI:GPT-5.6 與 Claude Fable 5 評測對決
為何重要
Physical AI 的落地瓶頸在於模型能否準確閱讀並遵循外部系統的嚴謹文件(如 NASA 技術備忘錄),而非僅滿足於內部邏輯的一致性。這項評測揭示了 LLM 在應用層上仍深度依賴「人類檢核」與「細節閱讀能力」,若無法有效解析規範並在真實物理環境中驗證推論,Agent 自動化將難以真正替代工程師的工作。
JuliaHub 發布研究,比較 OpenAI 的 GPT-5.6 家族與 Anthropic 的 claude-fable-5 在物理 AI 領域的表現,指出當前 LLM 在書面規範精確度與物理模擬層面仍存在明顯差距。
- 評測環境固定:使用 Dyad AI harness 進行測試,鎖定上下文視窗 100 萬、Token 預算 12.8 萬及高強度推理,確保僅有模型差異。
- 評分機制:包含 52 次評分,針對 5 個源自真實建模工作的密封難題,檢驗模擬軌跡是否符合物理正確性,而非單純程式碼執行。
- 關鍵發現:在最具挑戰性的 NASA HL-20 飛行載具問題上,所有受測模型均未解開;研究顯示不同模型在程式碼編輯與物理驗證的工作風格(work-style fingerprint)上截然不同。