ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

挖掘語言模型潛在推論策略

研究 1 個來源 · 7 天前
為何重要

這項研究直擊目前大型語言模型「黑盒」的核心痛點,提供了一種量化與拆解模型內部推理路徑的技術框架。 對資深開發者而言,這意味著我們不再只能觀察模型輸出的結果,而是能深入理解模型是如何在不同場景下切換策略(例如數值計算 vs. 符號邏輯)。 對產業而言,提升模型的「可解釋性」是提升信賴度、進一步應用於金融或法律等高風險場域的關鍵前提。

研究指出訓練於推理任務的語言模型雖然能解決問題,但其背後多樣化的策略卻隱藏在響應分佈中無法觀察。

本研究提出一種分解響應分佈的架構 $p_\theta(y|x) = (r_\phi(z|x), g_\phi(y|x,z))$,將輸入對映到隱含策略並由生成器輸出回應。

鑑於標準變分推論會導致「後驗坍縮」,作者提出衡量「分數訊息增益」的變分目標,強迫編碼器專注於降低基礎模型在「高驚訝度」 token 上的預測難度。

研究建構了包含多種策略的演算法任務,證實該目標能強制模型學習並還原出與不同參考策略對齊的潛在隱碼。

InterpretabilityVariational InferenceLLM ReasoningPosterior CollapseBenchmark

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00