從有限反饋下,利用 LLM 專家的於線路由學習
為何重要
此研究解決了 RAG 或 MoE 架構在冷啟動階段的痛點,允許系統在不消耗大量標記資料的情況下,透過使用者的少量反饋自動尋找最佳模型配置。對於開發者而言,此技術能降低整合多個 LLM 專家的最佳化門檻,使分散式模型策略更具可執行性。
研究提出演算法以解決在極少量回饋資源下,如何自適應性地將提示詞路由至特定的 LLM 專家,從而最大化回應品質。該方法將提示詞選擇問題形式化為帶有 K 個動作(專家)與 d 個特徵的流動 Bandit 問題。