AI數學最後一道高牆倒塌,GPT-6 Astra 刷穿 FrontierMath Tier 4
為何重要
GPT-6 Astra 的高分並不僅代表計算能力的提升,更驗證了模型在複雜邏輯推導上的成熟度,對於發展 AI 科學家與高階資料分析工具具有指標意義。同時,題目庫向「未解決問題」和「形式化證明」的轉型,也意味著 AI 生態將從單次試算轉向可驗證的證明程式開發。
FrontierMath 是由 Epoch AI 聯合 60 多位數學家(含陶哲軒等菲爾茲獎得主)設計的研究級數學評測,旨在測試大模型是否能解決科學研究難題。GPT-6 Astra 近期解決了該評測中唯一尚未被攻破的難題,導致官方宣佈該層級已達「飽和」狀態。
- FrontierMath v2 版本推恐前,Tier 4 題庫最初包含 50 道核心題,後因錯誤問題經過修正與篩選,最終剩餘 43 道題目前全部已被 AI 成功解答過一次。
- OpenAI 公佈的 GPT-6 Astra 在該測試中獲得 97.6% 的成績,超越了 Claude Fable 5(90.2%)與 GPT-5.6 Sol(83.0%),標誌著 AI 解題邁上新臺階。
- 當前 FrontierMath 正邁向新階段,引入「Open Problems」與「FrontierMath Erdős」,Astra 在後者 68 道需形式化證明的題庫中僅解出 2 道,顯示口徑仍有斷層。