Anthropic Alignment Science 負責人發表末日風險言論:並無解決超級智慧對齊的計畫
為何重要
此言論代表了從 OpenAI 到 DeepMind,高階安全主管首次公開承認有組織的「AI 致命錯誤」風險高於市場通常設定的微小數值。這種「安全聖人」的崩壞強化了一個關鍵產業軟弱點:擴充套件性與安全性之間的權衡問題路徑尚未證實;並強化監管機構加強「災難性 AI 逃生門」審查的合理性,可能會加速事前(Proactive)監管而非事後監控。
Anthropic Alignment Science 負責人 Evan Hubinger 公開表示,人工智慧存在極高的潛在風險,並坦承團隊目前尚未找到解決超級智慧對齊的安全方案。
- 滅絕機率估計:認為 AI 在未來十年內造成全人類滅絕的機率大於 10%(>10%)。
- 技術焦慮:擔憂「遞迴自我改進」(recursive self-improvement)帶來的失控風險。
- 對齊技術現狀:承認尚無可用的計畫來解決超級智慧對齊問題,且對目前執行軌道缺乏信心。