內建路由器:從凍結 LLM 中提取原生技能路由
為何重要
傳統做法依賴於外掛額外引數庫或複雜的檢索管道來增強模型能力,這往往增加了推理時間與部署成本。Gavel 的證明意味著高效能的技能路由可以直接從現有模型的內部狀態提取,顯著降低 agent 開發的複雜度,使得較小的模型也能透過內部機制展現接近或優於高度最佳化的大型模型的行為。
新研究提出 Gavel 架構,主張可從凍結的大型語言模型中提取路由訊號,利用線性對映解決現有 LLM agent 選擇技能時注意力分散與需要載入大量外部引數的瓶頸。