Inferact 展示 TPU 搭配 Megakernel 局勢逆轉,推理速度追上 NVIDIA GB200
為何重要
這個案例證明瞭「軟體最佳化」對於釋放不同硬體架構潛力的關鍵影響力,終端應用不再僅受制於 GPU 的算力單位價格。對開發者而言,掌握 Pallas 或 CUDA Graph 級別的 Kernel 開發能力,能在異質硬體(如 TPU、ASIC)上取得不成比例的競爭優勢。
推理最佳化創業公司 Inferact 透過手寫 Megakernel 核心與 DeepSeek DSpark 框架,在特定設定下讓谷歌 TPU v7 Ironwood 的推理速度顯著超越輝達 GB200,打破了「雲端 GPU 核心持續領先」的印象。
- 對決專案用 16 塊 TPU v7 Ironwood 與 16 塊輝達 GB200 測試 Kimi K3,獲得的 TPU 每秒 709 個 Token,GPU 僅 452 個,速度勝出 57%。
- 不只在大規模批次下表現優異,在 Batch Size 為 1 的單個請求場景下,TPU 每秒產出 249 個 Token,GB200 僅 127 個,差距接近一倍。
- Inferact 繞過 XLA 自動編譯,用 Pallas 語言手寫 Megakernel,單步 decode 耗時僅 8.5 毫秒,且無精確度損失。
- Inferract 團隊為 vLLM 原始開發者,公司已拿到 a16z 領投的 1.5 億美元種子輪,估值 8 億美元。