硬體愛好者以 $266 預算改造 Tesla V100,打造吵雜但強大的 32GB VRAM 本地 LLM 系統
為何重要
在視訊記憶體供應吃緊與價格高漲的背景下,這項 DIY 創舉提供了開發者一條利用二級市場殘值硬體(如 HBM 視訊記憶體卡)來突破本地 LLM 記憶體限制的低成本路徑。它驗證了透過異構架構合體(混用 Volta 與 Ada)與相容驅動,即使在耗能與噪音較高的情況下,仍能以合理成本獲得強大的本地推理能力。
- 硬體改造成本約 $266,透過 eBay 購買 Tesla V100 SXM2(16GB HBM2)搭配 PCIe 轉接卡(約 $66),並進行 PWM 介面修改以讓風扇受母板調控。
- 系統組合:RTX 4080(16GB Ada 架構)與 Tesla V100(16GB Volta 架構)共享 32GB VRAM,運作軟體採用 NixOS 與混搭架構支援的舊版 Nvidia 驅動。
- 推論效能:在 32GB 視訊記憶體加持下成功執行 270 億引數模型,生成速度達 32 tokens per second,足夠互動使用且優於多數雲端 API。