ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

測度檢核機制:GPU Kernel 基準測試的有效性研究

研究 1 個來源 · 1 天前
為何重要

這項研究揭露了主流基準測試工具在處理 GPU Kernel 的精度問題時,容忍度設定可能過寬,導致排序結果混淆了正確性與近似度。對於依賴模型排行榜來選擇技術供應商的投資人與開發者來說,現有評量標準的漏洞可能導致錯誤的決策,特別是針對需要高精度的應用場景。

現有的 LLM 生成 GPU kernel 基準測試依賴少量隨機輸入與寬鬆的浮點容忍度來判斷正確性,這些定論常用於排行榜與回饋機制的聲稱。由於缺乏測量工具,工程師難以判定現有修補手段是否足以解決弱點。本研究引入突變分析作為 adequacy metric,來量測 these oracles 的檢測能力。

  • 研究人員向 188 個 Hard-Core 模組注入 10,303 個可編譯的故障,其中 7,384 個具備獨立的致死見證。
  • 官方檢核機制會遺漏 16.9% 的已知故障,其中計算性錯誤僅遺漏 8.7%,但高精度錯誤有高達 78.6% 被遺漏。
  • 最佳化後的測試集在每個問題使用兩個輸入來對齊致死矩陣,可達到 98.0% 的檢測率(見證集外為 94.8%)。
KernelBenchmutation analysisGPU kernelsLLMbenchmarking

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00