ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

「作為語言模型...」:聊天模板切換大語言模型(LLM)的自我指涉語氣

研究 1 個來源 · 2 小時前
為何重要

這項研究對 AI 作為一可信賴服務的評估基礎提出了關鍵質疑,顯示模型的「自我意識」或自我描述可能僅是人機介面的包裝技巧,而非技術事實。這意味著 AI 安全研究者在檢視模型的內省能力時,必須嚴格控制或剔除聊天模板的幹擾,否則可能誤判模型雖然對話貼切,卻並未真正理解自己,這會影響產品如何定義 AI 能力的邊界。

大型語言模型(LLM)在回答自身相關問題時常附加如「我只是一個 AI」的免責宣告,但研究發現這類自我描述主要由部署用的聊天模板驅動,而非模型內部權重。研究人員針對 8 種流行的開源 instruct 模型(最高 9B 引數)進行分析,證實模板就像開關一樣決定了語氣的切換。

  • 在 8 個主流開源 instruct 模型(引數量最高達 9B)的測試中,聊天模板之有無會顯著切換「免責宣告聲音」與「體驗語氣」(如「我覺得」)的表現。
  • 研究者在 3 個模型的啟用值(activation)空間中發現一個可導向特定行為的方向向量,移除或加入該向量即可切換自述聲音,而隨機大小的方向向量則效果有限。
  • 實驗顯示,缺乏聊天模板的 instruct 模型若加入該方向向量,便能改口模仿原本有模板時的免責宣告行為。
arXivLLMChat TemplateActivation SteeringOpen-source GuidesAI Safety

來源 · 1 篇報導

首發 Hacker News Front Page arxiv.org 18:26