ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

7名博士生僅用3個月從零訓練7B大模型:程式碼+資料+訓練日誌全公開

工具 1 個來源 · 8 天前
為何重要

此案首次在基礎模型訓練環節具體展現了「由AI研發AI」的工程實力,證明瞭即便在資料清洗、實驗監控等重複性高、耗時的工作上,人機協同也能模擬大型團隊的運作效率。對產業而言,這驗證了透過工程微調與Agent團隊協作來降低訓練成本與時間的可行性。

北京中關村學院的7名博士生僅用3個月從零訓練出開源7B模型ZGCM-1,並公開了包含權重、資料配方、程式碼與完整工程日誌。團隊為應對工程挑戰,提出的「人+幾百個Agent」研發模式與自研ZGent平臺被納入技術框架。

  • ZGCM-1在通用評測中與Qwen3-8B等規模模型表現相似,但在部分推理與搜尋任務中可與Qwen3-235B-A22B、GLM-5.1等更大模型對比。
  • 研發流程被拆解為11類任務,核心參與者依據L1至L5自主性框架對Agent表現進行評級,其中實驗監控與部署已達到L4等級。
  • 為克服黑盒訓練問題,建立了由18類能力、183項檢查點及2503個探針構成的ACE原子能力評測體系,以追蹤除Loss外的能力變化。
  • 通過區域性與全域性注意力結合、Muon與FP8最佳化,在16K預訓練中達到相同Loss的效率,較標準BF16/AdamW基線提升約4.2倍。
ZGCM-1Agent模型工程評估體系資訊科學

來源 · 1 篇報導

首發 量子位 QbitAI qbitai.com 10:17