Guardrails 阻礙攻擊性網安研究?AI 正規化擋住合法防禦工作
為何重要
Guardrails 的極限設限挑戰了「防禦與攻擊本是一體兩面」的網安真理,因為要發現漏洞往往必須先模擬攻擊。這不僅讓真正具備應對未來大規模攻擊能力的專家被擋在門外,更可能導致關鍵的 AI 漏洞修復工作滯後,甚至迫使防禦方轉向對國家安全風險更高的開源或海外模型,影響長期的網安主導權。
AI 產業大廠為了防止惡意濫用,推出了嚴格的 Guardrails 與審查計畫,但這些措施如今反而限制了合法的攻擊性網安研究員與防禦者的作業效率。近期美國政府曾針對 Anthropic 的 Mythos 與 Fable 模型實施出口管制,雖然 Fable 5 已於 7 月 1 日恢復一般存取,但 Mythos 5 仍僅限特定美國審查機構使用。
- 研究:加州網安顧問公司 NCC Group 的 Anley 指出,若 Guardrails 強制模型拒絕回答漏洞利用問題,將阻礙研究人員確認漏洞的真實性與修復價值。
- 趨勢:為了避免資料外洩或被模型吸收進未來訓練,受訪者表示他們正轉向「在地部署」的開源模型(如 GLM)來進行漏洞開發與逆向工程。
- 爭議:研究員 Chris Thompson 質疑,這套機制不僅造成使用者需反覆與模型「溝通」(另起爐灶修復提示),更可能將優秀的防禦研究員推向不受管制的海外系統。