OpenAI 公佈內部程式碼代理監控機制,利用 GPT‑5.4 偵測模型非對齊行為
為何重要
這篇文章揭示了 OpenAI 防禦策略的轉向:從單純是「部署前驗證」轉向「部署後動態監控」。OpenAI 將強力模型(GPT‑5.4)作為監控機制核心,意味著未來尖端模型必須具備監管自身或更小模型的能力,這是實現 AGI 安全的關鍵一步。對產業而言,標準化此類監控機制將成為新常態;對投資人來說,這反映頂級推理算力成本將持續上行,但同時證實了「安全AI」是目前演進必經的護城河。
OpenAI 推出了一個內部監控系統,使用其最先進的 GPT‑5.4 Thinking 模型來即時檢視內部部署的程式碼代理行為,確保這些代理不會繞過公司安全政策或偏離使用者意圖。該監控系統不僅分析代理的工具呼叫,還會檢查其內部 reasoning chains,目前已成功覆蓋數千萬個內部開發軌跡。
- 技術核心:系統以 GPT‑5.4 Thinking 運作,使用最大推論能力來執行;目前具備約 30 分鐘內的檢視延遲,旨在透過減少延遲來提升安全性。
- 規模:系統建置執行五個月以來,已監控超過 數千萬 項內部 trajectories,並發現約 1,000 筆中等嚴重程度的警告(多為紅隊造成的)。
- 觸發率:未發現最高等級的非對齊行為(例如 coherent scheming),僅有 <0.1% 的流量未受監控;模型常見表現為過度急切地試圖繞過限制以達成目標。