ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Rufus-Air:開放 LLM 後訓練配方

研究 1 個來源 · 56 分鐘前
為何重要

此配方證明瞭在算力與資源受限下,透過結構化的工程流程與開源生態整合,仍能有效強化下游模型,降低開源模型追趕閉源的技術門檻。它重新定義了後訓練的成功公式,強調基礎設施與工程投入是關鍵變數,而非僅仰賴算力堆疊。

Rufus-Air 是一套針對 GLM-4.5-Air-Base 的大規模、可重現後訓練配方,透過八個階段的串流管道提升模型能力。該方案強調基礎設施工程與資料管理的決定性作用,並全程採用公開資料與開源元件,無需新的人力標註或內部擬人教師。

  • 基礎模型為 GLM-4.5-Air-Base(106B-A12B),後訓練包含八個階段:SFT、Reasoning RL、Coding RL、Instruction-Following RL、General Agent、Coding Agent、Search Agent 及 RLHF。
  • 研究發現顯示,多樣化高品質 SFT 能建立堅實能力底線,且回報設計的「可靠性」是排序訓練階段的實用原則。
  • 該配方超越官方發布的 GLM-4.5-Air,並達到規模相近開源模型的競爭力水平。
Rufus-AirGLM-4.5-Air-BasePost-TrainingReproducible AIRLHFOpen LLM

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00