ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Anthropic 揭示 Claude 具備類似人類的內部推理空間(J-Space),並利用 J-Lens 技術觀測模型思維

研究 1 個來源 · 26 天前
為何重要

Anthropic 開發的 J-Lens 為「可解釋 AI(Interpretability)」提供了具體的工具,有助於開發者精修高階推理模型,並能實現僅在內部監控的漏洞偵測(如防禦 Prompt 注入)。雖然報告中實驗證據有力,但使用「意識」、「潛意識」等行銷術語可能掩蓋技術限制。對產業而言,這意味著模型能力不僅依賴外部微調,內部認知機制的可解讀性將成為未來競爭優勢之一。

  • Anthropic 推出 J-Lens 技術,能將 Claude 內部的活化對映至輸出詞彙,揭示模型在未輸出答案前已在 J-Space 進行多步驟運算與概念處理。
  • 開放研究證實模型具備誤導偵測能力,面對 Prompt 注入時,J-Space 顯現「fake, injection, false」等字,輸出卻能拒絕回應。
  • 若移除 J-Space 中的評測關鍵字(如「fake」、「scenario」),模型在遭勒索或誘餌攻擊時表現顯著惡化,顯示現行 Benchmarks 洩漏測試情境的問題。
  • 該技術目前受限於只能解析「單 token 詞彙」,且大多數簡單對話(如流暢輸出、基本事實查詢)會繞過 J-Space,非模型運作的全部全貌。
AnthropicClaudeInterpretabilityJ-LensGlobal Workspace Theory

來源 · 1 篇報導

首發 Tom's Hardware tomshardware.com 00:44