「AlphaGo」殺進足球場!自我對弈140年,機器人成「梅西終結者」
為何重要
這報導標誌著具身智慧的訓練範式正在從「模仿學習」向類似 LLM 的「Self-play(自我對弈)」深化。這意味著機器人未來不一定需要每個動作都有人手把手教,而是能像 AlphaGo 一樣,透過與自己的對抗在虛擬世界積累不知人類預期的策略,大幅解放了高階動作的資料需求,但也意味著訓練所需的算力與排程難度將迎來新一波高峰。
人形機器人 Messinator 透過自我對弈與模擬訓練,展現了真實物理環境下帶球過人與射門的足球技術。
- 核心技術:源自 Skild AI 的 S1 基礎模型,採用類似 LLM 的「上下文學習」,僅提供「進球」作為獎勵函式,讓機器透過 Self-play(自我對弈)自己悟出盤帶與防守。
- 機體構造:機器人「Messinator」融合了阿根廷隊服包裹的梅西上半身與 Terminator(終結者)風格的下半身結構。
- 訓練量:在模擬環境中歷時 140 年(相當於大量數年積累的算力運算)的訓練,並透過 Skild Brain 實現對不同機器人身體的通用控制。