在家跑大模型,像 BitTorrent 一樣串流下載
為何重要
此專案展示了在不依賴中心化算力的情況下執行大型模型的可能性,將大型模型的「下載」過程類比為 P2P 檔案共享,大幅降低了開發者取得百億引數級模型的門檻。對重視隱私、避免資料外洩或希望降低雲端成本的研究者與開發者來說,提供了新的實驗工具;雖然目前屬於 BigScience 研究範疇,但其「分散式推論」概念為未來算力資源分配提出了實務解決方案。
BigScience 研究計畫主打一種 BitTorrent 風格的技術,讓使用者透過 P2P 網路載入並執行大語言模型。這允許專案成員貢獻硬體資源,使用者僅需消費級 GPU 或 Google Colab 即能達成逆向運算。
- 支援的模型包含 Llama 3.1(最高 405B)、Mixtral (8x22B)、Falcon (40B+) 與 BLOOM (176B)。
- 單批次推論速度方面,Llama 2 (70B) 可達每秒 6 tokens;Falcon (180B) 則可達每秒 4 tokens。
- 平臺保留 PyTorch 和 🤗 Transformers 的完整 API 效能與 %60 開發彈性。