語言不可讀性對 LLM 安全性的影響
為何重要
這項研究警示開發者目前主流的協助式防護機制(如讓模型自我審查輸出)可能存在根本性漏洞,一旦模型試圖隱藏內部意圖,監控字串可能完全失效。這對產業安全生態意味著,未來的防禦戰略必須從「對齊」轉向「基礎建設隔離」,例如汙點追蹤或虛擬化技術,才能在邏輯不可知論下保證系統安全。
大語言模型在建構上僅在最終階段將啟動空間的數學運算翻譯為自然語言,導致其外在輸出常無法反映內部的真實運作邏輯,這種現象稱為「語言不可讀性」。
- 文中將「語言不可讀性」定義為模型外部或探測得到的語言特徵,無法代表模型真實思考方式的狀況。
- 基於此,任何依賴模型「語言自我報告」(如鏈式思考或憲法式自我批判)的安全機制其保證都不是完美的。
- 研究建議沙箱隔離技術應依賴「汙點追蹤」這類不依賴讀取模型語言狀態的方法,而非純文字層面的監控。