Base Labs 推出與 Hugging Face、Goodfire 的開源模型安全合作
為何重要
此舉意圖改寫 AI 安全的生態系,挑戰「封閉即安全(publish safety, closed model」的觀點,轉而實踐「透過開放揭露與控制來確保安全」。對技術決策者來說,這代表部署開源模型時有了可參考的標準;對投資人而言,顯示出資本正從純粹的算力消耗轉向軟體層級的安全性基建,這類基礎設施若能普及,後進者將面臨更高的技術門檻。
Baseten 的研究機構 Base Labs 發布安全基礎設施標準,並與 Hugging Face 和 Goodfire 合作,試圖在日益興起的「去保護化(abliteration)」技術威脅下,建立一套開源權重模型的安全評估與監控架構。
- Base Labs 預計發布透明且內建於訓練過程的安全標準,以供眾人參考,並呼籲開發者參與該框架的建設。
- 鑑於移除模型安全防護的技術風險,Hugging Face 目前平臺上已列出的 abliterated models 超過 6,000 個。
- Base Labs 認為開放模型的透明度能促進更多可採取的安全控制,對比閉源模型更具優勢。