ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

從有限反饋下,利用 LLM 專家的於線路由學習

研究 1 個來源 · 9 天前
為何重要

此研究解決了 RAG 或 MoE 架構在冷啟動階段的痛點,允許系統在不消耗大量標記資料的情況下,透過使用者的少量反饋自動尋找最佳模型配置。對於開發者而言,此技術能降低整合多個 LLM 專家的最佳化門檻,使分散式模型策略更具可執行性。

研究提出演算法以解決在極少量回饋資源下,如何自適應性地將提示詞路由至特定的 LLM 專家,從而最大化回應品質。該方法將提示詞選擇問題形式化為帶有 K 個動作(專家)與 d 個特徵的流動 Bandit 問題。

LLM RoutingAdaptive LearningBandit AlgorithmRAGEfficiency

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00