ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

A*-Thought-V2:透過 LLM 幾何動力學實現高效的潛在推理

研究 1 個來源 · 14 天前
為何重要

本技術透過幾何動力學視角將推理過程重構為潛在軌跡,解決了傳統方法在保留推理細節與削減計算負擔之間的取捨難題。對開發者而言,降低高達 80% 的訓練成本與大幅縮減回應長度,意味著更可負擔的推理服務開發路徑。對產業而言,這種高效能的潛在推理架構若能驗證於主流模型,將直接最佳化雲端算力使用率並降低每執行步驟的資料傳輸成本。

為減輕鏈式思考(CoT)帶來的計算與上下文成本,研究團隊提出 A*-Thought-V2,這是一種模型 CoT 為隱含狀態軌跡的框架,將硬刪除取代為明確-隱含交錯的潛在架構。

  • 該系統將問題、步驟與解決方案投影至 3D PCA 空間,透過量測區域性轉換與全域性問題解決方向的對齊度,決定步驟是保留為文字或壓縮為潛在 token。
  • 實驗在 Qwen3.5-9B 與 Qwen3.6-27B 上的跨域基準測試顯示,平均準確率提升最高達 2.6%,回應長度減少一半。
  • 在引入逐步嵌入強制與標籤強制訓練後,該架構將計算單位準確率提升 2.29 倍,並分別將預處理時間與訓練時間降低 94.6% 與 80.3%。
A*-Thought-V2QwenLatent ReasoningGeometric DynamicsEfficient Computing

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 21:56