TeleAntiFraud 2.0:一個用於通訊詐騙檢測、可每月更新且「剖面導向」的音訊基準測試
為何重要
這項研究成果揭示了當前 AI 評估中的「近域負樣本」問題,以往使用不相關或離散主題的負樣本可能導致基準測試結果虛高。對開發者與業界而言,這份資料集強調了在真實混雜語境下測試模型的重要性,避免部署出只能在特定受控資料上表現良好、但一旦面對模糊邊界的真實場景就失效的系統。
TeleAntiFraud 2.0 是一個用於解決通訊詐騙指令碼演進與模仿合法服務對話問題的基準測試,採用混合樹生成管線來建構逼真的對話情境。
- 每月評估集使用冷凍協議,每組包含 900 通中文通話,其細分為 600 通詐騙案例與 300 通近域合法通話。
- 實證顯示,三個分類器在一般負向樣本下 Macro-F1 能達到完美數值,但若負樣本改為「近域兄弟類別」,效能會驟降至 0.65-0.68。
- 研究發現模型存在類別先驗捷徑、預測崩塌,且在快照式資料集上表現不佳。