ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

針對量子增強擴散語言模型的迴路超網路

研究 1 個來源 · 11 小時前
為何重要

整合量子計算與大型語言模型向來受制於噪音與資源成本。HyperQ 提出的欄位條件化電路發射與經典線性評估方法,證明瞭在凍結 backbone 上進行量子增強是技術可行的,為未來的混合運算架構提供重要參考。這種「小步快跑」的微調路徑可能成為穩健擴充套件 AI 能力的新方向。

語言模型可透過調整個別 token 的運算來適配。量子電路雖有潛力,但評估大型電路成本高昂。研究團隊提出 HyperQ,將 token 條件化的量子殘差分支加入凍結的遮罩擴散語言模型中,並證實其架構可行性。

  • 訓練規模:在 11 億引數的 backbone 模型中,HyperQ 成功訓練了 16 到 64 qubits 的電路。
  • 運作機制:量子殘差分支讀取 token 隱藏狀態,透過超網路發射旋轉角度,最後透過殘差連結加回測量值。
  • 評估優勢:使用精確的經典表示式進行期望值計算,評估成本隨 qubit 數呈線性增長。
  • 效能表現:在各下游 benchmark 中,64 qubits 的 HyperQ 超過 backbone 及低秩適配版本約 4.71 和 3.67 點。
  • 訓練效率:HyperQ 在 20,000 組 prompt-response 對上微調,相比經典基準的 200,000 絀大幅降低。
HyperQQuantumLanguage ModelDiffusion ModelResidual Branch

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00