MameLoshnLM:首個開源依地文 8B 引數語言模型與評測基準
為何重要
此專案證明瞭在開源基礎模型(如 Llama 3.1)上進行針對性譜系調整,配合專屬的高品質資料集,是解決低資源語言 NLP 難題的有效途徑,並揭露了當前通用語料在處理依地文等低資源語言時,因多語言混拌資料導致的具體誤差機制。雖然對商業市場即時影響有限,但此方法為「數位化程度低但文化歷史價值高」的語言提供了標準化的技術開發模板。
Hugging Face 團隊發布首款專為依地文設計的開源 8B 引數語言模型 MameLoshnLM。針對依地文數位語料匱乏與評測資源不足的挑戰,團隊建構了結合當代網路資源與文學作品的語料庫 Oytser,以及涵蓋翻譯、語言分析等多工任務的評測基準 Kashes。
- 模型基於 Llama 3.1 8B 進行繼續預訓練,以修正現有多語言模型在依地文資料上常見的噪音問題。
- 在 Kashes 基準的多項任務中,MameLoshnLM 的表現優於同規模的其他開放模型。
- 研究分析發現,相較於通用多語言模型,MameLoshnLM 能更準確地捕捉依地文的詞彙與形態學模式。