論文の概要: PAMI: Part Anchored Motion for Text to Human-Object Interaction Generation
- arxiv url: http://arxiv.org/abs/2609.38466v1
- Date: Tue, 29 Sep 2026 19:58:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.695189
- Title: PAMI: Part Anchored Motion for Text to Human-Object Interaction Generation
- Title(参考訳): PAMI: テキストとオブジェクトのインタラクション生成のための部分アンコレッドモーション
- Abstract要約: インタラクション生成のためのパート・アンコレッド・モーション・フレームワークであるPAMIを紹介する。
従来のHough Transformにインスパイアされた私たちの重要なアイデアは、ボディ部分のアンカーに投票させることでオブジェクトの動きをローカライズすることだ。
PAMIは従来の手法よりも忠実な相互作用とより正確な人間関係の物体の動きを生成する。
- 参考スコア(独自算出の注目度): 41.84042766842064
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-conditioned full-body human-object interaction (HOI) generation requires synthesizing human motion and object trajectories that match the input text while remaining precisely coordinated over time. Most methods represent the human and object as separate trajectories and predict the global human-object couplings. Learning this complex, dynamically changing relationship implicitly, however, often yields object drift, missed contact, and penetration. We introduce PAMI, a Part-Anchored Motion framework for Interaction generation. Inspired by the classic Hough Transform, our key idea is to localize object motion by letting body-part anchors vote for it: we express object motion relative to multiple body-part anchors and use PamiVAE to learn an interaction latent space, decoding frame-wise weights that aggregate these part-specific votes. Building on this representation, PAMI generates interactions in a coarse-to-fine hierarchy. PamiGen first generates a coarse human-object interaction from text in this structured latent space, and PamiRefiner then recursively resolves fine-grained contact geometry using a hybrid surface-sensing representation, combining long-range probes that capture overall body-part influence with short-range sensors that resolve detailed contacts near the object surface. Experiments on InterAct show that PAMI generates more faithful interactions and more accurate human-relative object motion than previous methods, achieving 14.5% higher contact recall than the previous state of the art. Extensive ablations validate the contributions of both the part-anchored voting representation and hybrid surface-sensing refinement.
- Abstract(参考訳): テキスト条件付きフルボディ・ヒューマン・オブジェクト・インタラクション(HOI)生成は、時間とともに正確に調整されたまま入力テキストに一致する人間の動きとオブジェクトの軌跡を合成する必要がある。
ほとんどの方法は、人間とオブジェクトを別々の軌道として表現し、グローバルな人間とオブジェクトの結合を予測する。
しかし、この複雑で動的に変化する関係を暗黙的に学ぶと、しばしば物体の漂流、接触の欠如、侵入をもたらす。
インタラクション生成のためのパート・アンコレッド・モーション・フレームワークであるPAMIを紹介する。
従来のHough Transformにインスパイアされた私たちのアイデアは、ボディ部分のアンカーに投票させ、オブジェクトの動きを複数のボディ部分のアンカーに対して表現し、PamiVAEを使って相互作用の潜在空間を学習し、これらの部分固有の投票を集約するフレームの重みをデコードする、というものです。
この表現に基づいて、PAMIは粗い階層構造で相互作用を生成する。
PamiGenはまず、この構造化された潜在空間のテキストから粗い人間と物体の相互作用を生成し、その後PamiRefinerは、ハイブリッド表面センシング表現を用いて細粒度の接触形状を再帰的に解決する。
InterActの実験は、PAMIが従来の方法よりも忠実な相互作用とより正確な人間関係の物体の動きを生成し、以前の最先端技術よりも14.5%高いコンタクトリコールを達成したことを示している。
包括的アブリゲーションは、部分アンコール投票表現とハイブリッド表面センシング精細化の両方の貢献を検証した。
関連論文リスト
- Surface Keypoint Representation for Multi-Object and Articulated Human-Object Interaction Generation [45.67585781847749]
本研究では,剛性成分の物体運動表現として曲面軌道を提案する。
この表現は、ポイントダイナミクスから直接、多目的調整と多様な調音機構を扱う。
HOI生成をテキストやウェイポイントから物体の動きを生成し、接触距離場を予測し、接触距離場を合成する3つの段階に分類する。
論文 参考訳(メタデータ) (2026-08-04T05:47:07Z) - MOCHI: Motion Enhancement of Collaborative Human-object Interactions [9.360852329235477]
協調的な人間と物体の相互作用は、参加者と共有対象との相互予測と継続的な調整を必要とする複雑な動きを示す。
ノイズの多いMHOIデータを改善するための2段階フレームワークであるMOCHIを提案する。
提案手法は,まず,雑音の多い身体入力から手の動きを最適化し,身体のポーズとセマンティックに整合した手の動きを生成する。
最適化の過程では,人・物・人・人のインタラクション情報を,これら1対1で符号化する最適化手法を導入する。
論文 参考訳(メタデータ) (2026-06-16T17:58:44Z) - HOIGS: Human-Object Interaction Gaussian Splatting [23.156838849980847]
複雑な人間とオブジェクトの相互作用で動的なシーンを再構築することは、コンピュータビジョンとグラフィックスの根本的な課題である。
本研究では,人間と物体間の相互作用による変形をモデル化したHuman-Object Interaction Gaussian Splatting (HOIGS)を提案する。
我々の手法は、最先端の人間中心と4Dガウスのアプローチを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-05T08:27:28Z) - CoopDiff: Anticipating 3D Human-object Interactions via Contact-consistent Decoupled Diffusion [62.93198247045824]
3Dヒューマンオブジェクトインタラクション(HOI)は,人間の将来の動きとその操作対象を,歴史的文脈で予測することを目的としている。
そこで我々は,人間と物体の運動モデリングを分離するために,2つの異なる分岐を用いた接触非結合拡散フレームワークCoopDiffを提案する。
論文 参考訳(メタデータ) (2025-08-10T03:29:17Z) - THOR: Text to Human-Object Interaction Diffusion via Relation Intervention [51.02435289160616]
我々は、リレーショナルインターベンション(THOR)を用いたテキスト誘導型ヒューマンオブジェクト相互作用拡散モデルを提案する。
各拡散段階において、テキスト誘導された人間と物体の動きを開始し、その後、人と物体の関係を利用して物体の動きに介入する。
テキスト記述をシームレスに統合するText2HOIデータセットであるText-BEHAVEを,現在最大規模で公開されている3D HOIデータセットに構築する。
論文 参考訳(メタデータ) (2024-03-17T13:17:25Z) - Full-Body Articulated Human-Object Interaction [61.01135739641217]
CHAIRSは16.2時間の多目的相互作用からなる大規模な動きキャプチャーされたf-AHOIデータセットである。
CHAIRSは、対話的なプロセス全体を通して、人間と明瞭なオブジェクトの両方の3Dメッシュを提供する。
HOIにおける幾何学的関係を学習することにより,人間のポーズ推定を利用した最初のモデルが考案された。
論文 参考訳(メタデータ) (2022-12-20T19:50:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。