K12-KGraph:用於評測與訓練教育型 LLM 的課綱對齊知識圖譜與基準
為何重要
該成果強烈暗示通用型指令微調語料已不足以支撐高水準的教育應用,必須匯入結構化且對應教學脈絡的專業監督資料。對產業與投資人而言,這提出了新的評估標準:學術價值高且針對課綱標註的垂直資料(Curriculum-Aligned Data)極有可能成為開發教育型 AI 產品時的決定性優劣關鍵。
現有大模型在 K-12 教育上的評測多偏重紙筆測驗,缺乏對課程先修邏輯、知識結構及視覺呈現的理解;研究團隊基於官方課本建立 K12-KGraph 知識圖譜,並衍生出相應的評測基準與圖譜引導訓練資料。
- 知識圖譜源自人民教育出版社(People's Education Press)的 K-12 數理化課本,包含九種節點型別與十四種關係型別。
- 研究發布了 K12-Bench 評測集,包含 23,640 道多選題與 Mechanism Reasoning 等五種任務家族。
- K12-Train 訓練資料集含 7,335 組範例(含 28% 純文字 QA 與 72% 多模態 VQA)。
- 在 2,300 樣本預算下,K12-Train-Text 在 GaokaoBench 與 EduEval 上優於市面上八個主流指令微調資料集。