ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

預測 LLM 金融推理可靠性:長期財報情境的真實測試

研究 1 個來源 · 1 天前
為何重要

這項研究直指目前主流 LLM 核心的缺陷,即僅能進行表面模式匹配,而非真正的結構性推理,尤其在缺乏公式提示時會嚴重失效。 對開發者而言,這意味著通用模型並不適合作為金融自動化的基礎,必須搭配針對性的監督微調或外部工具鏈來應對高認知負載的運算。 產業上,這意味著金融垂直 Agent 的商業落地需要額外的對齊技術,而非直接依賴通用基模的現成能力。

大型語言模型在長期財報情境下的推理能力備受質疑,現有評測指標因僅涵蓋裁剪表格與簡單問答,已無法反映真實產業的複雜度。

  • 研究團隊推出 FinIndices 基準,設計兩大任務:單一指標計算與表格索引推導,透過長達 32K token 的未截斷財報資料進行評估。
  • 實測發現模型脆弱性顯著,Gemini-3.1-Pro 在移除公式提示的零提示情境下,表格任務正確率從 70.70% 銳減至 38.22%。
  • 研究結果顯示,監督微調(SFT)可部分恢復結構邏輯,經過微調的模型在零提示情境下,單一指標正確率提升 8.54%,表格索引提升 3.82%。
FinIndicesLLMGemini-3.1Financial ReasoningBenchmarkSupervised Fine-Tuning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00