遞迴迴圈 Transformer (RLT):結合無界時間深度的架構
為何重要
RLT 代表了重新探索 Transformer 歸納偏置的一種嘗試,試圖打破序列長度限制並降低推理延遲。若能在長上下文推理的時間複雜度和去識別化方面取得實質突破,將為需要持續性狀態的 Agent 與邏輯鏈生成應用提供關鍵的架構基礎。
RLT 將因果編碼器與遞解碼器結合,透過滑動視窗注意力(SWA)快取來延續潛在運算,旨在同時實現無界時間深度與模型硬體的協同設計。編碼器建立全域性鍵-值記憶,而解碼器隨序列增長來擴充套件連續潛在運算,並在預訓練與 SFT 中共享完整狀態轉換。
- 架構採用 48 層編碼器與 48 層解碼器,階段間共用注意力與前饋網路權重。
- 經過 $t$ 個 tokens 後,時間路徑遍歷 $48t$ 個解碼器區塊,每個 token 執行 96 個邏輯區塊。
- 執行機制包含記憶體重用與啟用性檢查點儲存,以支援已知 token 的部份並行運算與重算。