RTK 誇大節省幅度?研究顯示成本不降反升
為何重要
這項研究用實證打破 AI 成本節流的常見迷思:壓縮終端機輸出(減少 token 數)並不能直接等同於降低 API 費用,尤其是在模型需要用更多回合來修正錯誤時。對於重度依賴 Agent 的開發者,不能僅仰賴工具提供的「節省率」指標,必須評估端到端的成本與成功率。
針對 GitHub 擁有 79k star 的工具 RTK(Rust Token Killer),作者在 Terminal-Bench 2.1 基準測試中測量了 Claude Code (Fable 5.0) 與 OpenCode (DeepSeek V4 Pro) 等模型的表現,發現雖然 RTK 理論上可減少 90% 的終端輸出,並未在實際執行中達到顯著成本節省的效果。
在 1,740 次嘗試中,Fable 實現了 3% 的成本降低,但 DeepSeek 的平均任務成本反而上升 17%,且任務通過率也降低了 2%。
造成這種結果的主因在於 RTK 導致 DeepSeek 的模型推理回合數增加了 18%,導致抵消了原始輸出的字元壓縮效益;單一 git-multibranch 任務因指令不相容導致 339 次失敗重試,累積成本是標準情境的 9 倍。