ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

低延遲 LLM 網路搜尋在通用 CPU 硬體上的三層式快取架構

基建 1 個來源 · 12 天前
為何重要

該架構證明瞭在受限的通用 CPU 運算資源上也能實現極致的 LLM 查詢效能,大幅拓寬了輕量級 AI 搜尋與 Agent 應用的部署邊界;透過精確的會話去重與 URL 嵌入快取,有效降低了企業在遠端 LLM 推理上的營運成本,為開發者提供了一個可依循的高效能實作藍圖。

OreoLook(原名 lixSearch)是一個使用瀏覽器代理與遠端 LLM 提供商的開源答案引擎,執行於通用 CPU 硬體上。為解決會話遺失上下文及重複查詢的問題,作者提出了一個包含會話視窗伺服器、語義查詢快取與 URL 嵌入快取的三層式架構。

  • 利用 Redis 維運滾動訊息視窗並自動溢位到壓縮磁碟封存,搭配後臺 LRU 機制在不斷擴充套件的會話中平衡記憶體與磁碟使用,以支援非即時對話恢復。
  • 部署於單臺 8 vCPU Intel Cascade Lake 伺服器,配置 30 個 Hypercorn worker,系統在 0.1ms 讀取延遲下達到 89.3% 的 Redis 鍵命中率,且記憶體開銷僅 1.38MB。
OreoLooklixSearchLLMCachingWeb Search

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00