訓練 3.8B 模型至 CORE 0.384 耗資 998 美元:低成本微調與硬體效率實務
為何重要
這篇貼文強烈反駁了「AI 訓練僅限於擁有巨型通訊阜和專有軟體的公司」的觀念,證明良好的軟體工程實務(如 config-driven 的 framework)和硬體濫用量最佳化可顯著降低成本。 對於產業而言,它突顯了即便在小型模型上,投資於最佳化演算法(如 Muon 最佳化器)和資料集選擇(如 ClimbMix),其回報率甚至高於大模型的基線調整,接收訓練曠日費時的迷思。
工程師 Hugo Vergnes 展現了在數千美元預算和下班時間內,個人也能訓練出有意義的大型語言模型(LLM),挑戰了這項工作僅屬研究實驗室的刻板印象。
結果聚焦於一個 3.8B 引數的模型,在 CORE 基準上取得 0.384 分,使用 65B tokens 的資料訓練 43 小時。
開發人員透過租用 NVIDIA B200s 和最佳化硬體利用率(使用 FP8 強制精度、詞彙表填充,以及 Trapezoidal 學習率排程),以相比 5090 基礎測試約 33% 的散熱提升了整體吞吐量。