在 4GB 電腦 GPU 與 Soup 工具上微調 8B 模型
為何重要
層級串流技術解決了過去在小型 GPU 上執行偏好對齊模型(如 DPO)所需的額外記憶體瓶頸,為個人開發者與新創團隊提供了免於被雲端供應商綁架的資源自主權。 - 這代表 AI 運算重心可從「重資產雲端」轉向「輕量化裝置」,大幅降低進入門檻。 - 誠實的效能資料包告(0.914x vs +730MB)而非理論假設,優化了開源工具的可信度與實用性。
Soup 針對在地本地 GPU 推出一個「一個設定,一個指令」的 LLM 微調工作流,使用 QLoRA 機制解決記憶體限制。
- 在 RTX 3050 4GB 上測試成功,透過層級串流(layer streaming)技術,DPO 微調僅需 730MB 額外記憶體即可運作(串流方法達到微調版 0.914x 峰值)。
- 版本 v0.72.4 新增在層級串流架上支援 DPO、ORPO、SimPO 和 KTO,並驗證了其 Loss 數值在數位精確度上與非串流版本完全一致(0.0 差異)。