ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

為臨床語言模型打造確定性數學解決方案

研究 1 個來源 · 8 天前
為何重要

這項研究證明瞭「工具呼叫(Tool Use)/程式碼執行」在特定高風險領域,能將中型開源模型的精準度拉開與直接推理的檔次,實質縮小了生產級 AI 的部署門檻。對醫療 AI 產業而言,它指出了從單純「堆疊模型引數」轉向「打造可靠執行環境與精準變數提取」的技術路徑變革。

針對大型語言模型在醫療算術上不可靠、易導致診斷價值觀測差異的問題,研究提出讓模型生成 Python 程式碼交由受限本地執行器具體執行的 Program-Solve 架構作為替代方案。

  • 在 MedCalc-Bench Verified 基準(包含 1,100 個案例與 55 個醫療計算機)上,Qwen2.5-32B-AWQ 採用 Program-Solve 策略達到 90.53%,顯著高於直接算術的 83.47%。
  • Qwen2.5-7B 採用 Program-Solve 策略表現為 75.31%,略高於直接算術的 72.02%,但兩者差異無顯著統計意義(95% 信賴區間為 [-3.49, 10.38])。
  • 研究對照手寫的 22-calculator 程式庫,該庫在 440 個案例上表現精準,但整體僅能支援 40.0% 的案例,遠低於模型方案。
Qwen2.5MedCalc-BenchPython executorTool useClinical AI

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00