地鐵自助終端基準測試 MetroLLM-Bench:驗證語言模型做為控制層的表現
為何重要
此發布證明瞭在資源受限的硬體裝置(如車站售票機)上部署「端側 AI」的商業潛力:輕量型、且經過特定領域微調的小模型,在特定複雜任務上的表現甚至優於龐大的通用型大模型。這不僅為垂直產業(公共交通、POS 機)的智慧化改造提供了具體的效能驗證,也向開發者傳遞出將大模型能力透過工具鏈結組裝而非僅依賴通用模型的重要性。
研究團隊推出 MetroLLM-Bench,專門評估語言模型作為公共交通櫃檯政策層的實力,涵蓋 955 個橫跨六個真實地鐵系統的實際情境。此基準測試著重模型呼叫結構化工具的能力,並採用分層評分機制。測試結果顯示,僅 2.6 GB 記憶體佔用的 4B Qwen 3.5 模型,透過 PEFT 微調後在 Tier 1 取得 91.3 分,表現優同樣規模的 GPT-5.6,且小模型並未隨規模擴大(9B/27B)而獲得額外優勢。