TypeSafe AI 決策模型 Jev 一週內打敗精靈寶可夢紅版
為何重要
此案例驗證了「混合模型」架構在處理高難度邊緣情境時的實際效能,即由 LLM 負責環境解讀與策略調整(昂貴/大腦),決策模型負責低延遲/低成本的即時選擇(高效/手),為開發複雜 AI Agent 框架提供了具體的分工參考。
TypeSafe AI 發布的 Jev 決策模型,在 Anthropic Claude Opus 5 的監控與策略調整下,於一週內完成精靈寶可夢紅版的挑戰並進入名人堂。該案例展現了非 LLM 專用模型如何結合語言模型解決複雜環境下的反覆錯誤,證明分工合作的效益。
- Jev 為決策模型而非 LLM,專注於從選項清單中根據機率輸出帶有信賴度分數的決策,不直接產生文字或讀取螢幕。
- 開發者透過 Claude Opus 5 最佳化,將傳送給 Jev 的文字量減少兩成,並將決策頻率控制為每六秒一次,避免模型陷入卡關迴圈。
- 開發 harness 的日誌共紀錄 474 項變更,包含遊戲中反覆出現的失敗案例,如進入勞雷爾大門 53 次誤判或 Rock Tunnel 梯子在一十分鐘內重複崩潰 124 次。