建構多語言橋樑:資料混合作為推論泛化的基石
為何重要
研究證實「推理」為一可跨語言轉移的通用行為,只要透過精細的資料混合與策略即可實現,減少對龐大專屬訓練資料的需求。對開發者而言,這是實現真正本土語言 AI 的可行技術路徑;對產業而言,強化了資料工程在模型泛化與區域化部署上的關鍵地位。
- 市面推理模型多為英語中心,即使收到非英語提示仍傾向用英語執行,本研究提出「L2 推論」以建立模型與使用者提示語言間的橋樑。
- 發布 33.5 億引數的 Tiny Aya L2-Thinker,在涉及數學、常識等領域的 6 個基準測試中,於 60 種語言上達到逾 93% 的 L2 推論率。
- 發現指出推理行為具語言無關性,透過廣泛的多語言非推理資料與英語推理基礎,即可將推理能力轉移至不同語系,不須為每種目標語言提供推理監督。
- 研究釋出模型權重與多語言推理資料以供進一步研究。