論文の概要: UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling
- arxiv url: http://arxiv.org/abs/2604.19734v1
- Date: Tue, 21 Apr 2026 17:57:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-22 22:41:49.914078
- Title: UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling
- Title(参考訳): UniT:人間とヒューマノイドの政策学習と世界モデリングのための統一物理言語を目指して
- Authors: Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge,
- Abstract要約: 人-人-人-人間移動のための統一物理言語を構築するためのフレームワークであるUniTを紹介する。
アクションは視覚を予測し、キネマティクスを物理的な結果に固定し、視覚はアクションを再構成し、無関係な視覚的共同創設者をフィルタリングする。
- 参考スコア(独自算出の注目度): 41.44664297185315
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling humanoid foundation models is bottlenecked by the scarcity of robotic data. While massive egocentric human data offers a scalable alternative, bridging the cross-embodiment chasm remains a fundamental challenge due to kinematic mismatches. We introduce UniT (Unified Latent Action Tokenizer via Visual Anchoring), a framework that establishes a unified physical language for human-to-humanoid transfer. Grounded in the philosophy that heterogeneous kinematics share universal visual consequences, UniT employs a tri-branch cross-reconstruction mechanism: actions predict vision to anchor kinematics to physical outcomes, while vision reconstructs actions to filter out irrelevant visual confounders. Concurrently, a fusion branch synergies these purified modalities into a shared discrete latent space of embodiment-agnostic physical intents. We validate UniT across two paradigms: 1) Policy Learning (VLA-UniT): By predicting these unified tokens, it effectively leverages diverse human data to achieve state-of-the-art data efficiency and robust out-of-distribution (OOD) generalization on both humanoid simulation benchmark and real-world deployments, notably demonstrating zero-shot task transfer. 2) World Modeling (WM-UniT): By aligning cross-embodiment dynamics via unified tokens as conditions, it realizes direct human-to-humanoid action transfer. This alignment ensures that human data seamlessly translates into enhanced action controllability for humanoid video generation. Ultimately, by inducing a highly aligned cross-embodiment representation (empirically verified by t-SNE visualizations revealing the convergence of human and humanoid features into a shared manifold), UniT offers a scalable path to distill vast human knowledge into general-purpose humanoid capabilities.
- Abstract(参考訳): ヒューマノイド基礎モデルのスケーリングは、ロボットデータの不足によってボトルネックとなる。
巨大なエゴセントリックな人間のデータは、スケーラブルな代替手段を提供する一方で、クロス・エボディメント・シャームをブリッジすることは、キネマティック・ミスマッチによる根本的な課題である。
UniT(Unified Latent Action Tokenizer via Visual Anchoring)は人-人-人-物間移動のための統合物理言語である。
異種キネマティクスが普遍的な視覚効果を共有するという哲学に基づいて、UniTはトリブランチのクロスコンストラクション機構(英語版)を採用している: アクションは、キネマティクスを物理的結果に固定するビジョンを予測し、視覚は、無関係な視覚的共同創設者をフィルタリングするためにアクションを再構成する。
同時に、融合枝はこれらの精製モダリティを、エンボディメントに依存しない物理的意図の共有された離散潜在空間にシナジーする。
私たちは2つのパラダイムにまたがってUniTを検証する。
1) 政策学習(VLA-UniT): これらの統一トークンを予測することにより、多種多様な人間のデータを効果的に活用し、ヒト型シミュレーションベンチマークと実世界のデプロイの両方において、最先端のデータ効率とロバストなアウト・オブ・ディストリビューション(OOD)の一般化を実現し、特にゼロショットタスク転送を実証する。
2)ワールド・モデリング(WM-UniT): 統一トークンを条件として、クロス・エボディメント・ダイナミクスを整列させることで、直接人-人-人-人の行動伝達を実現する。
このアライメントにより、人間のデータがシームレスにヒューマノイドビデオ生成のための強化されたアクション制御性に変換される。
最終的に、高度に整合したクロス・エボディメント表現(例えば、t-SNEの可視化によって、人間とヒューマノイドの特徴の共通多様体への収束が明らかになる)を誘導することにより、UniTは、膨大な人間の知識を汎用的なヒューマノイド能力に融合させるスケーラブルな経路を提供する。
関連論文リスト
- HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation [74.34984994596813]
HEXは、ヒューマノイドロボットの協調操作のための状態中心のフレームワークである。
ヘテロジニアスな実施形態をまたいだスケーラブルな学習のための、ヒューマノイドに整合した普遍的状態表現が組み込まれている。
タスクの成功率と一般化における最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-04-09T09:01:43Z) - UniHM: Unified Dexterous Hand Manipulation with Vision Language Model [39.2419824041854]
身体的に実現可能な器用な手操作を計画することは、ロボット操作と身体的AIにおける中心的な課題である。
自由形式の言語コマンドで案内される手操作を統一する最初のフレームワークであるUniHMを紹介する。
論文 参考訳(メタデータ) (2026-02-28T16:37:11Z) - Learning Whole-Body Human-Humanoid Interaction from Human-Human Demonstrations [63.80827184637476]
D-STAR(D-STAR)は,行動すべき場所から行動すべき場所を乱す階層的な政策である。
広範かつ厳密なシミュレーションを通じて、我々のフレームワークを検証する。
論文 参考訳(メタデータ) (2026-01-14T14:37:06Z) - MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training [102.850162490626]
人間のロボットによる相互模倣事前学習による視覚-言語-行動モデルであるMiVLAを提案する。
MiVLAは、最先端のVLAよりも優れた、強力な改良された一般化能力を実現する。
論文 参考訳(メタデータ) (2025-12-17T12:59:41Z) - UniBYD: A Unified Framework for Learning Robotic Manipulation Across Embodiments Beyond Imitation of Human Demonstrations [35.77665515297785]
インボディードインテリジェンスでは、ロボットと人間の手の間のエンボディーメントギャップは、人間のデモンストレーションから学ぶ上で大きな課題をもたらします。
動的強化学習アルゴリズムを用いて,ロボットの物理的特性に適合した操作ポリシーを検出する統一フレームワークUniBYDを提案する。
UniBYDを評価するために,多種多様なロボット形態にまたがるクロスボデーメント操作のための最初のベンチマークであるUniManipを提案する。
論文 参考訳(メタデータ) (2025-12-12T14:48:06Z) - ECHO: Ego-Centric modeling of Human-Object interactions [71.17118015822699]
ECHO (Ego-Centric Modeling of Human-Object Interaction) を開発した。
人間のポーズ、物体の動き、そしてそのような最小限の観察から接触の3つのモダリティを回復する。
同じ柔軟性を提供しない既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2025-08-29T12:12:22Z) - CoopDiff: Anticipating 3D Human-object Interactions via Contact-consistent Decoupled Diffusion [62.93198247045824]
3Dヒューマンオブジェクトインタラクション(HOI)は,人間の将来の動きとその操作対象を,歴史的文脈で予測することを目的としている。
そこで我々は,人間と物体の運動モデリングを分離するために,2つの異なる分岐を用いた接触非結合拡散フレームワークCoopDiffを提案する。
論文 参考訳(メタデータ) (2025-08-10T03:29:17Z) - HumanSAM: Classifying Human-centric Forgery Videos in Human Spatial, Appearance, and Motion Anomaly [15.347208661111198]
HumanSAMは、人間中心のフォージェリーを、生成されたコンテンツでよく見られる3つの異なる種類のアーティファクトに分類することを目的としている。
HumanSAMは、バイナリとマルチクラスの偽造分類の両方において、最先端の手法と比較して有望な結果をもたらす。
論文 参考訳(メタデータ) (2025-07-26T12:03:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。