ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

世界模型有觸覺了!50萬小時影片,訓出首個隱式觸覺世界動作模型

模型 1 個來源 · 9 天前
為何重要

過去的世界模型多依賴視覺,難以精準判斷觸覺發生的時機與受力,而 Being-H0.8 成功將觸覺推向「預測—執行—調整」的核心鏈路,這代表具身智慧正在從單純的視覺感知邁向 multimodal(多模態)的物理理解,是實現高精度劇本外操作的關鍵。 對研發者而言,這不再只是理論突破,而是提供了一套從海量無標註影片中提煉觸覺資訊的實用 pipeline(資料線路);對投資者而言,這展示了世界模型競爭的下半場——「資料內涵與統一性勝過架構花樣」,具備完整資料治理與多感官融合能力的團隊將建立更高的壁壘。

Being-Beyond 智在無界發布具備觸覺感知的隱式世界動作模型 Being-H0.8,將物理互動資料整合至世界模型預測鏈路中。

  • 業界首個具備觸覺能力的隱式世界動作模型:Being-H0.8 將觸覺納入隱空間表示,透過預測互動結果輔助動作生成,填補了世界模型在觸覺層面的空白。
  • 建立 5 萬小時級別的人類操控行為資料池:團隊彙集了來自數十家合作夥伴的超過 500,000 小時第一視角影片,並透過処理管線剔除無效片段、重建手部動態,形成目前國內最大的人類操作影片池 UniHand-3.0。
  • 解決觸覺資料缺失問題:釋出 TactoHand 模型,利用 30,100,000 幀人-物互動資料從影片幀中推斷稠密的接觸與鄰近度註解;同時引入約 55 小時、540 萬幀的壓力手套物理資料,進一步補足摩擦、壓力等細緻物理訊號。
  • 完成觸覺模態與動作空間的統一:採用「慢-快」動作專家結構與通用觸覺編碼器,將不同感測器資料轉換為統一觸覺 token,並透過 TopoHand 將人手、靈巧手與夾爪的動作空間對齊。
世界模型觸覺具身智慧Being-BeyondTactoHand隱式世界動作模型

來源 · 1 篇報導

首發 量子位 QbitAI qbitai.com 13:25