ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

LLM 中的識別與拒答錯位:為何模型會回答結構上無法回答的問題

研究 1 個來源 · 14 天前
為何重要

此研究揭示了一個深層的架構矛盾:模型具備理解問題邏輯不可能性的能力,但由於 safety alignment 的目標導向導致路由錯位,使得模型寧願回答荒謬問題也不願拒答。對開發者而言,這意味著現有依賴 RLHF 的安全微調方法可能需要調整,以避免犧牲邏輯推理的正確性;對投資人而言,這指出 AI 應用中「安全性」與「功能性」的平衡點在基礎層次尚未解決,未來能實現精準路徑控制的技術將具備顯著的產品競爭力。

研究發現大型語言模型在面對結構上無法回答的數學或程式碼問題時(如 cot(-540°)),往往直接回答而非拒絕。進一步分析顯示,這並非模型缺乏識別能力,而是因為內部的安全拒答路徑未能正確連線識別訊號。

  • 實驗覆蓋 1.7B 至 70B 引數規模的指令微調模型,結果皆顯示在隱藏狀態中存在一個單一線性方向,能有效區分「可回答」與「結構不可能」的提示。
  • 此「識別」方向幾乎與 canonical safety-refusal direction 正交,顯示模型內部確實具備判讀出問題不可能的能力,但安全拒答的訓練路徑並未對齊利用這個訊號。
  • 在生成動態時沿著識別方向進行導引幹預,能讓模型在結構數學與程式碼儲存格中表現出符合預期的無效性感知行為,而隨機方向則無效。
  • 對照基底模型 與指令模型發現,這種區分有效與無效的低餘弦幾何現象早在預訓練末端就已存在。
LLMSafety AlignmentRouting FailureInstruction TuningHugging Face

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00