NOLLI:用於診斷英韓效能落差的可調整難度謎題基準
為何重要
過去評估模型多聚焦於「語言量」或通用基準,這項研究具體檢驗了模型在非拉丁文字系統中的推理強健性。 研究發現結構尺寸並非難度虛POI,真正的效能瓶頸在於多步驟子音(Jamo)解析或特定語言文化知識(如 Kinship 邏輯)的限制,這對於規劃多語言產品策略或 AI 安全性測試具體明確的指標意義。
Hugging Face Daily Papers 發布了名為 NOLLI 的程式化基準,專門用來診斷各類大型語言模型在英語與韓語間的效能落差。
- 基準包含 15 種謎題型別、25 個任務及 7,500 個專案,透過「行為校準」確保每個例項皆有唯一解。
- 實測 15 款前沿與韓國開發模型發現,12 款整體準確率超過 3%,且英韓準確率在統計學上具等效性。
- 書寫系統處理是關鍵弱點:Korean Cipher 僅韓語表現就比英語落後高達 68.7 個百分點。