Google 推出 Gemini Robotics ER 2:賦予機器人的高階規劃與多機協作能力
為何重要
Google 此舉將 embodied AI 研發重心從底層視覺感知推向高層決策邏輯,標誌著機器人控制架構正轉向「模型即大腦」的模組化生態。此舉大幅降低了開發者整合複雜系統 API 的門檻,解決了長久以來模型推理延遲幹擾實務部署的痛點,對推動具身智慧從實驗室邁向真實工廠與生活場景具有深遠影響。
為了讓機器人在物理世界更實用,Google 發布了新一代的機器人控制模型「Gemini Robotics ER 2」,定位為機器人的「高階大腦」以取代分散的系統控制。
- 它具備即時影片理解與進度追蹤能力,能處理 80-100% 等五個階段的進度分類,準確率達 57.4%。
- 在關鍵時刻識別(moment-finding)上達到 91.3% 準確率與 0.96 秒平均絕對距離,在更小的運算成本與 4 倍執行速度下提供低延遲的物理世界決策能力。
- 模型支援多機器人協作(如與 Apptronik Apollo 2 與 Franka F3 Duo),並已透過能源串流整合 Gemini Live API 實現即時動作排程。
- 開發者可透過 Gemini API、Google AI Studio 或 Enterprise Agent Platform 存取該模型。