ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

TensorRT Edge-LLM 搭配 Jetson AGX Thor 在 MLPerf Edge Agentic Benchmark 跑出 6.4 倍佳績

硬體 1 個來源 · 6 天前
為何重要

此成果證實了高階邊緣裝置(如 Jetson AGX Thor)既能且善於執行複雜的 AI Agent 工作流,這對強調「端側運算」的汽車與機器人產業是關鍵的一步。利用 NVFP4 與樹狀 MTP 技術解決了邊緣運算中 DRAM 頻寬與延遲的瓶頸,顯示 NVIDIA 正在強化其在高規 Agent 應用落地的技術護城河。

NVIDIA 使用 TensorRT Edge-LLM 在搭載 Blackwell 架構的 Jetson AGX Thor 開發板上,針對 AI Agent 長上下文推理任務取得極致的效能突破。

  • 模型採用 Qwen3.6-27B,在單一 Jetson AGX Thor 和 MAXN 模式下,達到每秒 52.33 個 Token。
  • 完成耗時長達 1,007 輪的 Agent 工作負載,僅需 24 分 36 秒,比 llama.cpp 參考執行(Q4_K_M 量化)快 6.4 倍。
  • 透過 NVFP4 量化權重與啟用、FP8 KV Cache、以及 KV Cache 重用(命中率約 96%)技術顯著降低記憶體負擔。
  • 採用基於樹狀結構的多 Token 預測(Tree-based MTP),在函式呼叫場景下比線性 MTP 額外帶來約 40% 的解碼收益。
NVIDIAJetson AGX ThorTensorRT Edge-LLMMLPerfQwen3.6-27BNVFP4

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 04:37