ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

T1:用於長期目標的終端代理強化學習模型

模型 1 個來源 · 12 天前
為何重要

T1 展示了強化學習在封閉式開發環境(如終端機)中解決長程計畫的可行性,其透過 MoE 與工具呼叫限制的突破,為開發可靠的程式自動化 Agent 提供了技術藍圖。分析師應關注此種「專用於工具呼叫的長程 RL」與通用基礎模型之間的效能優勢範圍,這可能意味著即便在 GPT 系列等通用模型日趨強大的背景下,特定領域的 Agent 技術仍有報酬率高的突破空間。

隨著 Agent 應用逐漸從單次互動轉向 coding 與科學探索等長序任務,直接操作終端機的操作型 AI 變得至關重要。研究團隊發布了 T1 模型,這是一個總引數量達 122BMixture-of-Experts (MoE) 架構,透過強化學習在雲端沙箱模擬真實終端機,並支援每個任務長達 300+ 次工具呼叫。透過具體技術解法(TITO 與 R3)將對數機率落差縮減至 0.013,T1 在 Terminal-Bench 2.1 測試中將任務解決率從 43.8% 提升至 64.0%,並在長時程終端測試以 27.9% 表現超越 GPT-5.4GLM-5.1

T1Terminal AgentReinforcement LearningMoETerminal-Bench 2.1

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00