StudentBench:AI 輔導並不輸給人類,且成本極低
為何重要
這份研究將 AI 的評價標準從單純的模型引數轉向實際的「應用價值」與「成本效益」,證明瞭在教育場景下,LLM 確實具備以極低成本取代人類輔導的潛力。 對於產業而言,StudyBench 作為開源基準測試工具,能有效推動 AI 教育工具的客觀化評估,降低創業家在教學效果的驗證門檻。
儘管大型語言模型發展多著重於模型能力,本研究提出 StudentBench 平臺,透過 17.5 萬則 AI 與學生的互動訊息,驗證了 AI 教練在 GRE 學習上的效果。
- 研究在量化語言 GRE 測驗中測試了 2,383 名參與者,結果顯示 AI 輔導在統計學上等同於專家人類輔導 (p = .015),且在七個領域中有五個表現優於人類。
- 成本效益分析極為驚人:表現最佳的 AI 輔導員獲取相同學習增益的費用僅為人類教練的 1/918(單位百分點 AI 花費 $0.0052,人類 $4.81)。
- 評測發現 AI 回覆速度與學生參與度呈正向相關,回覆越快導致學生發出的訊息越多、答對練習題的機率越高。