論文の概要: MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text
- arxiv url: http://arxiv.org/abs/2608.10162v2
- Date: Sat, 15 Aug 2026 05:45:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.025148
- Title: MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text
- Title(参考訳): MAD-HOI:テキストからの手指操作生成のためのマスク付き自己回帰拡散
- Abstract要約: HOI 生成用 Masked Autoregression with Diffusion (MAD-HOI) モデルを提案する。
提案手法は,手動と物体の動きを連続的な潜伏空間に符号化し,ストリームワイズ制御を維持するためにアンタングルを保ったままにすることから始める。
MAD-HOIは、原子および複合的な調音配列の運動生成、条件付き動作完了および埋め込み、および単一の訓練目標からのEOM(End of Motion)予測を行うことができる。
- 参考スコア(独自算出の注目度): 4.764824772285089
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Methods for text-based generation of hand-object interaction (HOI) sequences primarily focus on producing smooth, physically plausible trajectories. A truly utilitarian method should additionally support variable-length generation, composite motion sequences, motion completion and infilling, and reliable termination without compromising physical plausibility. Standard diffusion models for HOI generation are typically trained only for text-to-motion generation on atomic motions and require the motion length to be specified a-priori. Autoregressive (AR) methods provide greater sequence-level flexibility, but commonly depend on discrete motion codes, which can lose contact-sensitive motion detail. To address these key limitations, we present a model performing Masked Autoregression with Diffusion for HOI generation (MAD-HOI). Our method starts by encoding hand and object motions in a continuous latent space while keeping them disentangled to maintain stream-wise control. This is followed by a masked autoregressive transformer to predict context features that condition a flow-matching head. MAD-HOI is capable of motion generation for atomic and composite articulated sequences, conditioned motion completion and infilling, as well as EOM (End of Motion) prediction from a single training objective. We provide comprehensive evaluations for these capabilities and benchmark our method on the ARCTIC and GRAB datasets. Our experiments demonstrate that our method generates more diverse and physically plausible interactions compared to other open-sourced baseline methods.
- Abstract(参考訳): テキストベースで手オブジェクト間相互作用(HOI)を生成する方法は、主にスムーズで物理的に妥当な軌跡を生成することに焦点を当てている。
真に実用的な方法は, 物理的妥当性を損なうことなく, 可変長生成, 複合動作シーケンス, 運動完了と充満, 信頼性の高い終了をサポートする必要がある。
HOI生成のための標準拡散モデルは、通常、原子運動のテキスト・トゥ・モーション生成のためにのみ訓練され、運動長をa-prioriに指定する必要がある。
自己回帰(AR)法はシーケンスレベルの柔軟性が向上するが、一般的には個別の動作符号に依存しており、接触感応運動の詳細を失うことがある。
これらの制約に対処するために, HOI 生成のための Diffusion with Diffusion (MAD-HOI) を用いた Masked Autoregression のモデルを提案する。
提案手法は,手動と物体の動きを連続的な潜伏空間に符号化し,ストリームワイズ制御を維持するためにアンタングルを保ったままにすることから始める。
これに続いて、フローマッチングヘッドを条件としたコンテキスト特徴を予測するマスク付き自己回帰変換器が提供される。
MAD-HOIは、原子および合成調音シーケンスの動作生成、条件付き動作完了および埋め込み、および単一の訓練目標からのEOM(End of Motion)予測を行うことができる。
我々はこれらの機能に対する総合的な評価を行い、ARCTICおよびGRABデータセット上で手法をベンチマークする。
実験により,本手法は,他のオープンソースベースライン手法と比較して,より多様性があり,物理的に妥当な相互作用を生成することが示された。
関連論文リスト
- CosmoH2G: A Hand-to-Gripper Transfer Dataset and Baseline Method for Object Manipulation with Complex Spatial Movements [63.40365657068892]
ロボットグリップに人手によるデモンストレーションを移すことは、最近、ロボット学習の費用対効果の高いソリューションとして浮上した。
このギャップに触発された我々は、きめ細かい手の動きによって導かれる暗黙的なデータ駆動アプローチを採用した。
シミュレーションと実ロボット実験の両方において、我々のフレームワークは複雑な空間操作の安定かつ高精度なハンド・トゥ・グルーパー転送を可能にする。
論文 参考訳(メタデータ) (2026-09-07T13:47:22Z) - SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control [72.5651722107621]
SCRIPTは、言語駆動の物理に基づくヒューマノイド制御のための多段階トレーニングフレームワークを備えたスケーラブルな拡散ポリシーである。
SCRIPTの中核はJAST-DiT(Joint Action-State-Text Diffusion Transformer)であり、アクション、物理状態、テキストを専用トークンストリームとして表現している。
自己回帰制御を安定させるために,近年の密集した文脈を保存し,長期的歴史から疎開したサンプルを抽出する非線形履歴条件付け機構を導入する。
論文 参考訳(メタデータ) (2026-05-21T14:17:21Z) - HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching [113.81911881001905]
HO-Flowはテキストと正準3Dオブジェクトから現実的な手動動作シーケンスを合成するためのフレームワークである。
まず、手動と物体の動きのシーケンスを統一された潜在多様体に符号化するために、相互作用を意識した変分オートエンコーダを用いる。
次に、自己回帰的時間的推論と連続的な潜伏生成を組み合わせたマスク付きフローマッチングモデルを利用する。
論文 参考訳(メタデータ) (2026-04-12T22:06:11Z) - Diffusion Model-based Activity Completion for AI Motion Capture from Videos [2.9271399793140076]
現在のAIモーションキャプチャ法は、従来のモーションキャプチャと同様、観察されたビデオシーケンスに完全に依存している。
本稿では,人間の動作系列を相補的に生成する拡散モデルに基づく動作完了手法を提案する。
ゲートモジュールと位置時間埋め込みモジュールを導入することで,Human3.6Mデータセット上での競合的な結果が得られる。
論文 参考訳(メタデータ) (2025-05-27T05:04:50Z) - Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion [33.9786226622757]
テキスト記述から3次元動作を生成するための頑健な動き生成フレームワークMoMADiffを提案する。
我々のモデルはフレキシブルなユーザ提供仕様をサポートし、動き合成の空間的側面と時間的側面の両方を正確に制御できる。
提案手法は, 動作品質, 命令忠実度, 定着度において, 常に最先端のモデルより優れる。
論文 参考訳(メタデータ) (2025-05-16T09:06:15Z) - Auto-Regressive Diffusion for Generating 3D Human-Object Interactions [5.587507490937267]
HOI生成の鍵となる課題は、長いシーケンスでの相互作用の一貫性を維持することである。
本稿では,次の連続トークンを予測する自己回帰拡散モデル(ARDHOI)を提案する。
このモデルはOMOMOとBEHAVEのデータセットで評価されている。
論文 参考訳(メタデータ) (2025-03-21T02:25:59Z) - Text-guided 3D Human Motion Generation with Keyframe-based Parallel Skip Transformer [62.29951737214263]
既存のアルゴリズムは、コストがかかりエラーを起こしやすい全シーケンスを直接生成する。
本稿では,入力テキストに対応する人間の動作系列を生成するKeyMotionを提案する。
我々は,自動エンコーダを潜在空間に投影するために,Kullback-Leibler正規化付き変分符号器(VAE)を用いる。
逆拡散のために,デザインラテントとテキスト条件の相互参照を行う新しいパラレルスキップ変換器を提案する。
論文 参考訳(メタデータ) (2024-05-24T11:12:37Z) - Seamless Human Motion Composition with Blended Positional Encodings [38.85158088021282]
後処理や冗長な復調ステップを伴わずにシームレスなヒューマン・モーション・コンポジション(HMC)を生成する最初の拡散モデルであるフローMDMを紹介する。
我々はBabelとHumanML3Dデータセットの精度、リアリズム、スムーズさの観点から最先端の結果を得る。
論文 参考訳(メタデータ) (2024-02-23T18:59:40Z) - Priority-Centric Human Motion Generation in Discrete Latent Space [59.401128190423535]
テキスト・ツー・モーション生成のための優先中心運動離散拡散モデル(M2DM)を提案する。
M2DMは、コード崩壊に対処するために、グローバルな自己注意機構と正規化用語を組み込んでいる。
また、各動きトークンの重要度から決定される革新的なノイズスケジュールを用いた動き離散拡散モデルを提案する。
論文 参考訳(メタデータ) (2023-08-28T10:40:16Z) - Executing your Commands via Motion Diffusion in Latent Space [51.64652463205012]
本研究では,動作遅延に基づく拡散モデル(MLD)を提案し,条件付き入力に対応する鮮明な動き列を生成する。
我々のMDDは、広範囲な人体運動生成タスクにおいて、最先端の手法よりも大幅に改善されている。
論文 参考訳(メタデータ) (2022-12-08T03:07:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。