ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

HarnessOpt-Bench:評估 LLM 的 Harness 最佳化能力

研究 1 個來源 · 6 小時前
為何重要

本項研究劃時代的意義在於將競爭場域從純粹的模型權重擴充套件至「系統工程能力」,證明開發者最佳化 Prompt 與 Harness 策略將成為未來 AI 系統效能的關鍵差異化因素。對開發者而言,意味著在部署智慧體應用時,必須同時投資於環境的調整與最佳化;這也標誌著衡量 AI 模型的標準出現了新維度——即 AI 系統是否能夠自治地迭代改進自身的執行規範。

隨著 LLM 迅速融入智慧體系統,其效能不單取決於模型權重,更依賴周圍的 Harness(包含提示、工具與控制流程等規範)。為了量化「自動 Harness Optimization」這項重要卻困難的智慧體自治技能,研究團隊推出了 HarnessOpt-Bench,並在多次實驗中測量前緣模型在此維度的表現。

  • 介紹 HarnessOpt-Bench,這是一個端到端 harness optimization 標準協議,運作於昂貴且隨機的評估環境,並利用可信執行環境 (TEE) 來強制評估邊界與計費。
  • 評測模型作為 Optimizer,接收 seed harness 與評分回饋,並在固定評估預算下編輯 harness 以提升 normalized gain,總計進行 111 個 scored runs。
  • 實驗證明,optimizer 模型通常比其依賴的 coding harnesses 有更好的區分度,且儘管 native harnesses 不 consistently 優越,但確立了 Harness optimization 為一項具備廣大改善空間的可測量能力。
HarnessOpt-BenchLLMIntelligent AgentsAutomated OptimizationBenchmark

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00