ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

持久狀態機:大型語言模型注意力的完整數學證明與 Vivado 實現 (Version 8.0)

研究 1 個來源 · 4 天前
為何重要

此研究驗證了將複雜的 LLM 注意力運算轉換為硬體持久狀態機的可行性,這是一種專注於極度低功耗與資源效率的另類算力路徑,試圖解決邊緣運算裝置在執行大型模型的能耗痛點。 從產業觀點來看,這項技術路線若要落實,需仰賴 Custom Hardware 或特定 FPGA 專案,短期內不具備挑戰主流雲端 GPU 供應鏈的基本盤動力,更多是學術界對 RISC-V-like 或非同步邏輯在 AI 推理上應用的探索。

研究人員提出利用持久狀態機(PSMs)作為大型語言模型注意力機制的數學框架,主張利用靜態機內單元進行廣播運算與離散狀態轉換,並提供了關於量化誤差範圍及有限自動機等效性等課題的完整數學證明。

  • 在 Xilinx Zynq-7000 平臺上實驗了 1024 單元陣列(d=128)的 Out-of-Context 開發,顯示核心邏輯動態功耗估計低於 1.0 mW。
  • 於 AWS Cloud FPGA Developer 環境下,在 UltraScale+ SoC 中整合 PCIe Gen3 介面與 AXI4 匯流排,系統時鐘達 62.5 MHz,最壞情況時間餘裕(WNS)為 +1.854 ns。
  • 該架構執行於極低資源佔用模式,僅佔用 0.67% 邏輯切片與 0.00% DSP 塊,並透過 1,000+ 個隨機向量模擬確認位元級精確性。
Persistent State MachinesLLM AttentionFPGALow PowerQuantizationXilinx

來源 · 1 篇報導

首發 Hacker News Front Page zenodo.org 09:01