VākQA:坦米羅語聽覺式問答基準與評估研究
為何重要
此研究揭示了當前多模態與多語言 AI 的資料盲點,證實了自動評估指標在低資源語言場景下的顯著偏差。它提醒開發者,僅靠模型的泛化能力無法解決跨語言語意保留與 ASR(語音辨識)錯誤累積的技術痛點,必須引入更具判斷力的評估工具或針對特定語言進行最佳化。
大型語言模型在問答領域的進展多集中在高資源語言,針對坦米羅語等低資源語言的聽覺式問答(SQA)仍屬空白。本文推出 VākQA 基準,解決自動評估準確度未知的問題,並測試了專有與開源模型的能力。
- 資料集包含 2,001 組事實型質問回應對,分佈於六個領域,並提供 2.53 小時語音音訊、雙語字幕及經人工驗證的參考答案。
- 評估實驗顯示,Gemini 最接近人工判斷,而開源評鑑模型會將答案表面形式與參考解答有異的正確坦米羅語答案判定為錯誤。
- 研究指出坦米羅語具有翻譯易流失的文化特定用語,聽覺輸入會因發音混淆改變題意,且 ASR-MT 串聯錯誤會逐漸放大。