論文の概要: GIRAF: Towards Generalizable Human Interactions with Articulated Objects
- arxiv url: http://arxiv.org/abs/2607.07880v1
- Date: Wed, 08 Jul 2026 19:30:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.326932
- Title: GIRAF: Towards Generalizable Human Interactions with Articulated Objects
- Title(参考訳): GIRAF:Articulated Objectsとの汎用的ヒューマンインタラクションを目指して
- Authors: Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye,
- Abstract要約: そこで本論文では,テキスト条件付き拡散モデルについて述べる。
提案手法は、現在最先端の手法を超越して、未確認のオブジェクト構成に強い一般化を示した。
- 参考スコア(独自算出の注目度): 50.52795413484619
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthesizing realistic full-body human interactions with articulated objects is a fundamental challenge for embodied AI and graphics, with applications in robotics training and virtual agents. Existing models remain limited: some focus on simple activities with static objects, while others restrict attention to hand-only manipulation. This leaves open the problem of generating coordinated full-body motion that approaches, manipulates, and moves articulated objects in a realistic and generalizable way. The key difficulty lies in reasoning jointly about locomotion, fine-grained contact, and object articulation. Models must capture subtle hand-object correspondences that transfer across object geometries, while also producing seamless transitions from navigation to manipulation. At the same time, the scarcity of large-scale paired motion-scene data makes it difficult to generalize across diverse object positions and shapes. We introduce a text-conditioned diffusion model that addresses these challenges through three core ideas: an object-centric representation that unifies hand-object contact with object surfaces, a mixed-domain training strategy that balances locomotion and interaction, and a contact-based augmentation scheme that expands training diversity. Through experiments, our method demonstrated strong generalization to unseen object configurations, surpassing current state-of-the-art methods.
- Abstract(参考訳): 人工的な物体と現実的なフルボディの人間のインタラクションを合成することは、ロボット工学のトレーニングや仮想エージェントに応用することで、AIとグラフィックを具現化する上での根本的な課題である。
既存のモデルは限定的であり、静的オブジェクトによる単純なアクティビティに焦点を当てたものもあれば、手のみの操作に注意を向けるものもある。
このことは、現実的で一般化可能な方法で物体を接近させ、操作し、移動させる調整された全身運動を生成するという問題を解き放つ。
重要な困難は、移動、きめ細かい接触、および物体の明瞭さについて共同で推論することにある。
モデルは、オブジェクトのジオメトリを横断する微妙なハンドオブジェクト対応をキャプチャし、ナビゲーションから操作へのシームレスな遷移を生成する必要がある。
同時に、大規模なペア移動シーンデータの不足により、多様な物体の位置や形状をまたいだ一般化が困難になる。
対象物と物体との接触を統一するオブジェクト中心表現、移動と相互作用のバランスをとる混合ドメイントレーニング戦略、学習の多様性を拡大するコンタクトベースの拡張スキームの3つの基本アイデアを通じて、これらの課題に対処するテキスト条件拡散モデルを導入する。
実験により,本手法は,現在最先端の手法を超越した未確認オブジェクト構成に対して強い一般化を示した。
関連論文リスト
- LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model [14.98308724969322]
LOMEは、入力画像、テキストプロンプト、フレームごとのヒューマンアクションに条件付けされたビデオとして、現実的な人間とオブジェクトのインタラクションを生成することができる。
LOMEは、空間的人間の行動を共同で推定することで、オブジェクト操作に強力で正確なアクションガイダンスを注入する。
LOMEは、シミュレーション環境に制限されずに、AR/VR体験とスケーラブルなロボットトレーニングの道を開く。
論文 参考訳(メタデータ) (2026-03-28T23:58:29Z) - ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning [19.292101162897975]
本稿では,幾何的に一貫したオブジェクト図面を持つ実写HOIビデオを生成するByteLoomを紹介する。
まず、相対座標マップ(RCM)をオブジェクトの幾何整合性を維持する普遍表現として活用するRCM-cache機構を提案する。
次に、モデル能力を進歩的なスタイルで向上し、ハンドメッシュの需要を緩和するトレーニングカリキュラムを設計する。
論文 参考訳(メタデータ) (2025-12-28T09:38:36Z) - Diffgrasp: Whole-Body Grasping Synthesis Guided by Object Motion Using a Diffusion Model [25.00532805042292]
本稿では,身体,手,与えられた物体の動き列の関係をモデル化する,シンプルで効果的な枠組みを提案する。
我々は,新たな接触認識損失を導入し,データ駆動型,慎重に設計されたガイダンスを取り入れた。
実験の結果,本手法は最先端の手法より優れ,至適な全身運動系列を生成することがわかった。
論文 参考訳(メタデータ) (2024-12-30T02:21:43Z) - Controllable Human-Object Interaction Synthesis [77.56877961681462]
本研究では,3次元シーンにおける同期物体の動きと人間の動きを生成するための制御可能な人間-物体相互作用合成(CHOIS)を提案する。
ここでは,高レベルな計画から効果的に抽出できるスタイルや意図を言語記述が通知し,シーン内の動きをグラウンド化する。
我々のモジュールは経路計画モジュールとシームレスに統合され、3D環境における長期的相互作用の生成を可能にします。
論文 参考訳(メタデータ) (2023-12-06T21:14:20Z) - Object Motion Guided Human Motion Synthesis [22.08240141115053]
大規模物体の操作におけるフルボディ人体動作合成の問題点について検討する。
条件付き拡散フレームワークであるOMOMO(Object Motion Guided Human Motion synthesis)を提案する。
我々は、操作対象物にスマートフォンを装着するだけで、全身の人間の操作動作をキャプチャする新しいシステムを開発した。
論文 参考訳(メタデータ) (2023-09-28T08:22:00Z) - Task-Oriented Human-Object Interactions Generation with Implicit Neural
Representations [61.659439423703155]
TOHO: 命令型ニューラル表現を用いたタスク指向型ヒューマンオブジェクトインタラクション生成
本手法は時間座標のみでパラメータ化される連続運動を生成する。
この研究は、一般的なヒューマン・シーンの相互作用シミュレーションに向けて一歩前進する。
論文 参考訳(メタデータ) (2023-03-23T09:31:56Z) - Learning to Transfer In-Hand Manipulations Using a Greedy Shape
Curriculum [79.6027464700869]
本研究では, 動的シミュレーションにおける簡易物体の自然な, 頑健な手動操作が, 高品質なモーションキャプチャの例から学習可能であることを示す。
本稿では,ティーポット,バニー,ボトル,トレイン,ゾウなど,さまざまな対象に適用可能な,単純なグリージーなカリキュラム検索アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-03-14T17:08:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。