TensorRT Edge-LLM 搭配 Jetson AGX Thor 在 MLPerf Edge Agentic Benchmark 跑出 6.4 倍佳績
為何重要
此成果證實了高階邊緣裝置(如 Jetson AGX Thor)既能且善於執行複雜的 AI Agent 工作流,這對強調「端側運算」的汽車與機器人產業是關鍵的一步。利用 NVFP4 與樹狀 MTP 技術解決了邊緣運算中 DRAM 頻寬與延遲的瓶頸,顯示 NVIDIA 正在強化其在高規 Agent 應用落地的技術護城河。
NVIDIA 使用 TensorRT Edge-LLM 在搭載 Blackwell 架構的 Jetson AGX Thor 開發板上,針對 AI Agent 長上下文推理任務取得極致的效能突破。
- 模型採用 Qwen3.6-27B,在單一 Jetson AGX Thor 和 MAXN 模式下,達到每秒 52.33 個 Token。
- 完成耗時長達 1,007 輪的 Agent 工作負載,僅需 24 分 36 秒,比 llama.cpp 參考執行(Q4_K_M 量化)快 6.4 倍。
- 透過 NVFP4 量化權重與啟用、FP8 KV Cache、以及 KV Cache 重用(命中率約 96%)技術顯著降低記憶體負擔。
- 採用基於樹狀結構的多 Token 預測(Tree-based MTP),在函式呼叫場景下比線性 MTP 額外帶來約 40% 的解碼收益。