論文の概要: ComplexMimic: Human-Scene Interaction Imitation in Complex 3D Environments
- arxiv url: http://arxiv.org/abs/2607.02034v2
- Date: Fri, 03 Jul 2026 05:22:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 13:04:58.51789
- Title: ComplexMimic: Human-Scene Interaction Imitation in Complex 3D Environments
- Title(参考訳): ComplexMimic:複雑な3D環境における人間とシーンのインタラクション模倣
- Abstract要約: 物理に基づくヒューマン・シーン・インタラクション(HSI)の模倣学習は、インテリジェンスを具現化する上で重要である。
本稿では,複雑な環境におけるHSIの模倣に着目した。
我々は,不完全なMoCapデータを解釈することで,多様なHSIを再構築するフレームワークであるComplexMimicを提案する。
- 参考スコア(独自算出の注目度): 8.22506959232814
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Physics-based Human-Scene Interaction (HSI) imitation learning is crucial for embodied intelligence as it bridges the gap between kinematic 3D motions and real-world dynamics. However, most existing methods focus on simplified scene settings, leaving complex environments largely unexplored, which limits their applicability in real-world scenarios. In this paper, we focus on HSI mimicry in complex environments. Under this complex setting, we observe an inherent trade-off between successfully performing interaction and maintaining natural, physically plausible motions. To address this challenge, we propose ComplexMimic, a framework that reconstructs diverse HSI by interpreting imperfect MoCap data. First, we introduce a Dual Flow Strategy, which learns two complementary experts: an imitation expert for accurate motion tracking and an interaction expert for collision-aware adaptation in complex scenes. Second, naive multi-expert distillation, which treats all experts equally, often under-samples challenging behaviors, limiting effective learning. To mitigate this issue, we propose a difficulty-aware distillation strategy that adaptively weights supervision and prioritizes hard-yet-learnable trajectories guided by failure statistics and learning progress signals. Extensive experiments on three benchmark datasets demonstrate that our approach outperforms current state-of-the-art methods.
- Abstract(参考訳): 物理に基づくヒューマン・シーン・インタラクション(Human-Scene Interaction, HSI)の模倣学習は、キネマティック3Dモーションと現実世界のダイナミックスとのギャップを埋めるため、インテリジェンスを具現化する上で重要である。
しかし、既存のほとんどの手法はシーン設定の単純化に重点を置いており、複雑な環境はほとんど探索されていないため、現実のシナリオでは適用性が制限されている。
本稿では,複雑な環境におけるHSIの模倣に着目した。
この複雑な環境下では、対話をうまく実行し、自然な、物理的に妥当な動きを維持することの間の本質的にのトレードオフを観察する。
この課題に対処するために,不完全なMoCapデータを解釈することで,多様なHSIを再構築するフレームワークであるComplexMimicを提案する。
まず,2つの相補的な専門家: 正確な動き追跡のための模倣専門家と,複雑な場面における衝突認識適応のための相互作用専門家を紹介する。
第二に、すべての専門家を平等に扱う、素直な多専門家蒸留は、しばしば、効果的な学習を制限する、挑戦的な振る舞いを過小評価する。
この問題を軽減するため,本研究では,障害統計と学習進行信号によって導かれるハード・イット・ラーニング・トラジェクトリを適応的に重み付けし,優先する,困難に配慮した蒸留戦略を提案する。
3つのベンチマークデータセットに対する大規模な実験は、我々のアプローチが現在の最先端手法よりも優れていることを示している。
関連論文リスト
- CosmoH2G: A Hand-to-Gripper Transfer Dataset and Baseline Method for Object Manipulation with Complex Spatial Movements [63.40365657068892]
ロボットグリップに人手によるデモンストレーションを移すことは、最近、ロボット学習の費用対効果の高いソリューションとして浮上した。
このギャップに触発された我々は、きめ細かい手の動きによって導かれる暗黙的なデータ駆動アプローチを採用した。
シミュレーションと実ロボット実験の両方において、我々のフレームワークは複雑な空間操作の安定かつ高精度なハンド・トゥ・グルーパー転送を可能にする。
論文 参考訳(メタデータ) (2026-09-07T13:47:22Z) - Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild [49.77540427384148]
本稿では,基礎モデルの汎用的マルチモーダル推論能力を野生でのHOI検出に伝達する,訓練不要なエージェント型フレームワークであるAgenHoIを提案する。
不完全な相互作用発見と複雑な場面におけるあいまいな局所化の課題に対処するために,2つの重要なメカニズムを導入する。
AgentHOIは、リアルタイム設定において、最先端の教師付きおよび弱教師付きメソッドよりも優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-07-15T14:30:20Z) - Rendering Multi-Human and Multi-Object with 3D Gaussian Splatting [47.35917581534084]
ロボット工学とVR/ARのための高忠実なデジタルツインを作るには、複数の対話する人間とオブジェクトをスパースビューから再構築することが不可欠である。
この問題はマルチHuman Multi-Objectレンダリングと呼ばれ、2つの重要な障害を生じさせる。
3D Splatting上に構築された新しい階層型フレームワークMM-GSを提案する。
論文 参考訳(メタデータ) (2026-04-03T12:20:36Z) - Emerging Extrinsic Dexterity in Cluttered Scenes via Dynamics-aware Policy Learning [27.1809716948267]
乱雑な環境下で,接触によって引き起こされる物体のダイナミクスを学習的に表現することで,政策学習を容易にするフレームワークを提案する。
提案手法は、包括的操作、人的遠隔操作、および事前表現に基づくポリシーを25%以上の成功率で上回る。
論文 参考訳(メタデータ) (2026-03-10T16:40:30Z) - MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction [54.36564144414704]
MeshMimicは、3Dシーンの再構築とインテリジェンスを組み込んだ革新的なフレームワークで、ヒューマノイドロボットがビデオから直接「モーション・テライン」インタラクションを学習できるようにする。
現状の3次元視覚モデルを活用することで、我々のフレームワークは、人間の軌跡と基礎となる地形や物体の3次元幾何学の両方を正確にセグメント化し再構築する。
論文 参考訳(メタデータ) (2026-02-17T17:09:45Z) - ContactGaussian-WM: Learning Physics-Grounded World Model from Videos [25.368710400385392]
本研究では,複雑な物理法則をスパースやコンタクトリッチなビデオシーケンスから直接学習できる物理地上剛体世界モデルであるContactGaussian-WMを提案する。
大規模シミュレーションと実世界の評価により、ContactGaussian-WMは複雑なシナリオの学習において最先端の手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2026-02-11T16:48:13Z) - Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation [90.90219129619344]
本稿では,スパイキング機能を備えたR-prior-S, Recurrent Geometric-priormodal Policyを提案する。
物理的現実の高レベル推論を基礎として、軽量な2次元幾何学的帰納バイアスを利用する。
ロボット行動生成におけるデータ効率問題に対して,再帰的適応スパイクネットワークを導入する。
論文 参考訳(メタデータ) (2026-01-13T23:36:30Z) - From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning [59.88543114325153]
本稿では,航法基礎モデルの強化学習能力を高めるためのSeeing-to-Experiencingフレームワークを提案する。
S2Eは、ビデオの事前トレーニングとRLによるポストトレーニングの長所を組み合わせたものだ。
実世界のシーンを3DGSで再現した3D画像に基づく総合的なエンドツーエンド評価ベンチマークであるNavBench-GSを構築した。
論文 参考訳(メタデータ) (2025-07-29T17:26:10Z) - Spatial Understanding from Videos: Structured Prompts Meet Simulation Data [89.77871049500546]
本稿では,事前学習された視覚言語モデルにおける3次元空間推論を,アーキテクチャを変更することなく拡張するための統一的なフレームワークを提案する。
このフレームワークは、複雑なシーンと質問を解釈可能な推論ステップに分解する構造化プロンプト戦略であるSpatialMindと、多様な3Dシミュレーションシーンから構築されたスケーラブルな質問応答データセットであるScanForgeQAを組み合わせる。
論文 参考訳(メタデータ) (2025-06-04T07:36:33Z) - Dynamic Manipulation of Deformable Objects in 3D: Simulation, Benchmark and Learning Strategy [88.8665000676562]
従来の手法は、しばしば問題を低速または2D設定に単純化し、現実の3Dタスクに適用性を制限する。
データ不足を軽減するため、新しいシミュレーションフレームワークと、低次ダイナミクスに基づくベンチマークを導入する。
本研究では,シミュレーション前トレーニングと物理インフォームドテスト時間適応を統合するフレームワークであるDynamics Informed Diffusion Policy (DIDP)を提案する。
論文 参考訳(メタデータ) (2025-05-23T03:28:25Z) - InterMimic: Towards Universal Whole-Body Control for Physics-Based Human-Object Interactions [27.225777494300775]
このフレームワークは、単一のポリシーで、何時間も不完全なMoCapデータからしっかりと学習することができる。
実験の結果,InterMimicは複数のHOIデータセットにまたがって,現実的で多様なインタラクションを生成できることがわかった。
論文 参考訳(メタデータ) (2025-02-27T18:59:12Z) - Robust Visual Imitation Learning with Inverse Dynamics Representations [32.806294517277976]
我々は,専門家環境と学習環境を整合させるために,逆ダイナミクス状態表現学習目標を開発する。
抽象状態表現を用いて、行動データと専門家データとの類似性を徹底的に測定する効果的な報酬関数を設計する。
提案手法は,ほとんどの環境においてほぼ熟練した性能を実現し,最先端のビジュアルIL法やロバストIL法を著しく上回っている。
論文 参考訳(メタデータ) (2023-10-22T11:47:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。