為何大型語言模型不擅長表格預測
為何重要
這項研究揭示了通用 LLM 在處理結構化表格資料時存在明顯的能力天花板,即使是最先進的模型也在高維情境下遜色於 50 年前的經典演算法。這證明瞭專為表格資料設計的模型利基市場確有其必要性,也提醒開發者在使用 LLM 處理資料科學任務時,維度問題將直接影響效能。
儘管大型語言模型(LLM)已是許多工的預設工具,但在常見的「表格資料預測分析」表現不佳,破解此現象正是表格基礎模型領域興起的主因。
- 研究在無工具、無代理架構、無微調的單次生成模式下,系統性檢驗五個導致 LLM 在表格預測失敗的假設。
- 對 31 個基準資料集進行隨機線性投影實驗,結果發現 LLM 是九種方法中唯一隨維度增加準確率下降的模型。
- 2D 維度下 LLM 預測行為接近區域性距離方法,網格吻合度高達 91.6%;但在高維度下,即使傳統模型加入適配的噪聲也無法複製其特徵。