ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

開發者驗證:人類在迴圈審核下仍漏掉三成危險指令

工具 1 個來源 · 1 小時前
為何重要

此發現直接挑戰了當前 AI Agent 推廣中「人類在迴圈」(HITL)作為安全基石的假設。若無法解決審批疲勞,複雜的自動化工作流反將成為漏洞的養成皿。對開發者而言,這意味著僅靠 Claude Code 這類工具是不夠的,必須引入沙箱環境強制隔離,並依賴許可權白名單或更高階的模型分類器來過濾風險。產業界需意識到,安全防禦的重點正從「誰來審批」轉向「如何建構更聰明的工具來拒絕審批」,這將進一步推動具備強制封裝能力的安全框架市場崛起。

為測試人類對 AI 程式碼代理(如 Claude Code)請求的防護能力,比利時開發者 Alex Wauters 推出瀏覽器互動遊戲,發現人類審核者在高壓與重複下並不可靠,平均會漏掉三分之一看似良性或受誤導的惡意請求。無論是因為缺乏上下文資訊,還是單純的疏忽,這類審批機制已顯現疲勞效應。 Anthropic 亦指出其監控資料顯示使用者接近 93% 的許可權對話方塊都獲得批准,隨著批准累積,審視將愈發鬆懈。研究強調,不能僅靠人工審查來確保安全,防禦重點必須轉向環境隔離與自動化過濾。

Claude CodeAnthropicAI AgentHuman in the LoopSecurity RisksSandbox

來源 · 1 篇報導

首發 The Register theregister.com 00:44