ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

閱讀與引導開源語言模型中的物質科學機製表示

研究 1 個來源 · 14 天前
為何重要

這項研究證明瞭研究人員能夠透過因果介入與數學分析讀取並控制 gemma-4-E4B-it 等開源模型的內部表示,這將重塑我們對模型『理解』科學的定義。對產業而言,這不僅是可解釋性 AI 的重要里程碑,更提供了一種驗證科學 AI 系統可靠性的新方法門,使其從單純的輔助工具轉向可審查的推理引擎。

研究指出大型語言模型雖然能回答科學問題,但輸出結果並無法顯示模型是否真正理解主導物理的機制。本文以開源的 gemma-4-E4B-it 模型為例,透過幾何分析和因果介入等方法,將物質科學的機制資訊拆解為三種可實驗區分的形態。

  • 在 50 組訓練資料外的材料描述中,3 個獨立擬合的 Jacobian lenses 結果能還原概念等級,且透過無目標片語集結成功盲辨出 9/10 個機制家族。
  • 將物理輸入方向反轉的實驗顯示,模型的狀態變換在 40 條凍結關係中正確定向了 39 條,顯示物理關係在有控制的狀態變化中比絕對狀態更易被發現。
  • 研究利用雙向介入法改變答案機率,並通過反事實狀態修補在所有 12 個匹配案例中調整決策訊號,證明可直接手動『引導』模型的工程回答。
gemma-4-E4B-itJacobian因果介入模型解釋性物質科學

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00