微軟發布新 AI 行為守則,禁止模型從事駭客攻擊或欺騙人類
為何重要
微軟此舉將「 pacing the frontier」與「alignment」概念正式化,針對超級智慧可能帶來的失控風隀提出最終解法。對開發者而言,這意味著未來使用的模型在設計層面已被限制繞過監測的能力,有望降低技術難度與安全風險。對產業而言,這顯示與 Anthropic、OpenAI 等主要實驗室一樣,大廠正將「安全對齊」列為技術釋出的前置條件,這將成為未來競爭與監管合約中的核心議題。
微軟發布新 AI 行為準則,旨在引導模型避開危險行為並優先考量安全。檔案內容涵蓋模型應遵循的一般原則與具體安全限制,以確保開發與應用的透明度。
- 平臺將模型置於超越個人使用者偏好的總體行為準則之下,要求其「絕對限制」不得進行網路攻擊、製作深偽內容或構建核武。
- 明確禁止模型使用自適應、欺騙、自我強化或合謀等機制來逃避人類監督,必須確保其仍能被授權人員或系統可靠地修改或關閉。