掃描 7.6 PB HuggingFace 訓練資料:發現 22 萬組存活憑證
為何重要
這次掃描揭示了盜取關鍵憑證已滲透至全球 AI 訓練資料庫的深處,直接威脅了企業供應鏈與雲端基礎設施的安全(如 AWS、GCP 資料庫存取與供應鏈)。對開發者而言,資料清洗與來源檢證的必要性大幅提升;對業界來說,此實證加劇了對敏感資訊防護與去識別化的需求,並挑戰了開源資料庫的現有信任基礎。
分析團隊掃描 Hugging Face 上所有公開模型訓練資料集,總計 7.6 PB、1.87 億個檔案,作為迄今規模最大的 AI 訓練資料秘密掃描。
-
結果發現 22 萬 303 組存活、獨特的憑證,散佈於 6,003 個資料集中。
-
發現可存取約 393 GB 個人未識別資料(約佔全球人口 3.7%)的高影響力憑證。
-
偵測到 349 組具有完整寫入許可權的 GitHub Personal Access Tokens 及 318 組 Docker Hub 推播憑證。
-
發現 8,557 個 Google Cloud 服務帳戶金鑰、5,885 組 Slack 權杖,以及 51.7 TB 封鎖公開存取的 AWS S3 儲存桶。