10 美元微控制器也能跑 LLM?開發者將 28.9M 引數模型部署在 ESP32-S3
為何重要
此案例證明透過高階量化與權重解除安裝技術,即使資源受限的 Edge 裝置也能執行具備一定推理能力的模型,這對於未來具備本地化、低延遲功能的 IoT 裝置極具示範意義。然而,受限於 TinyStories 模型本身的語意處理規模,目前仍無法應用於複雜對話、程式碼生成等實務任務,更多是技術上的炫技性突破。
日前一名開發者透過極致技術手段,成功在 ESP32-S3 微控制器本地執行來自 Microsoft Research 的小型語言模型。
- 硬體規格:目標硬體為 ESP32-S3,擁有 520KB SRAM、8MB PSRAM 及最高 16MB Flash 儲存。
- 技術手段:採用 8-bit 量化技術(減少記憶體需求約 75%)以及 Google Gemma 系列的 Per-Layer-Embedding (PLE) 技術將約 25M 引數的權重解除安裝至 Flash。
- 運作成果:在極限壓縮下,模型推論速度達到每秒 9.88 tokens,超越一般人的閱讀速度;而即使在未壓縮下,原模型仍需約 60MB 記憶體,ESP32 無法直接執行。