論文の概要: HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- arxiv url: http://arxiv.org/abs/2606.28215v1
- Date: Fri, 26 Jun 2026 16:05:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.534411
- Title: HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- Title(参考訳): HAT-4D:人間とエージェントの協調による4次元多目的インタラクションのためのモノクロビデオのリフティング
- Authors: Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li,
- Abstract要約: HAT-4Dは、単一のビデオから複数の物体の3次元幾何学、時間力学、物理的相互作用を再構成する。
スケーラブルなデータエンジンとして、HAT-4Dはモノクロ4Dインタラクション再構築のためのオープンワールドベンチマークであるMVOIK-4Dの作成を容易にする。
- 参考スコア(独自算出の注目度): 38.16996826492207
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Extracting dynamic 4D object interactions from massive, in-the-wild monocular videos offers a highly efficient data collection pathway for scaling Embodied AI and training VLAs. However, existing monocular 4D reconstruction methods primarily focus on isolated objects, often failing under the severe occlusions and complex dynamics inherent in multi-object interactions. To bridge this gap, we propose HAT-4D, the first agentic framework designed to reconstruct the 3D geometry, temporal dynamics, and physical interactions of multiple objects from a single video. By integrating VLMs with a multi-level human-in-the-loop feedback mechanism, HAT-4D efficiently resolves depth ambiguities and interaction-induced occlusions during 3D generation and 4D propagation, yielding physically plausible assets without relying on expensive multicamera rigs. As a scalable data engine, HAT-4D facilitates the creation of MVOIK-4D, an open-world benchmark for monocular 4D interaction reconstruction, accompanied by a novel multi-dimensional evaluation protocol focused on physical plausibility and temporal consistency. Extensive experiments demonstrate that HAT-4D achieves SOTA performance on most evaluation metrics, while maintaining competitive semantic alignment. Ablation studies show that introducing a small amount of human feedback improves interaction reconstruction. Moreover, the data produced by HAT-4D effectively improves baseline performance when used for fine-tuning. Our data and code are available at https://lijiaxin0111.github.io/HAT4D/
- Abstract(参考訳): 巨大な一眼レフビデオからダイナミックな4Dオブジェクトインタラクションを抽出することで、Embodied AIをスケーリングし、VLAをトレーニングするための、極めて効率的なデータ収集パスを提供する。
しかし、既存の単分子4D再構成法は主に孤立した物体に焦点を合わせ、しばしば重篤な閉塞と多物体相互作用に固有の複雑な力学の下で失敗する。
このギャップを埋めるために,1つのビデオから複数の物体の3次元形状,時間的ダイナミクス,物理的相互作用を再構築する最初のエージェントフレームワークであるHAT-4Dを提案する。
マルチレベルヒューマン・イン・ザ・ループフィードバック機構とVLMを統合することで、HAT-4Dは3次元生成と4次元伝播における深度あいまいさと相互作用によって引き起こされる閉塞を効率よく解決し、高価なマルチカメラ・リグに頼ることなく物理的に妥当な資産を得る。
スケーラブルなデータエンジンとして、HAT-4Dはモノクロ4Dインタラクション再構築のためのオープンワールドベンチマークであるMVOIK-4Dの作成を促進する。
HAT-4Dは、競争力のあるセマンティックアライメントを維持しながら、ほとんどの評価指標でSOTA性能を達成することを示した。
アブレーション研究により、少量の人間のフィードバックが相互作用の再構築を改善することが示されている。
さらに、HAT-4Dによって生成されたデータは、微調整に使用する際のベースライン性能を効果的に向上する。
我々のデータとコードはhttps://lijiaxin0111.github.io/HAT4D/で入手できる。
関連論文リスト
- High-Fidelity 4D Hand-Object Capture via Multi-View Spatiotemporal Tracking and Physics-Aware Gaussians [38.0162622592412]
同期・校正されたマルチビュービデオから手や物体を頑健かつ正確に再構成するための新しいシステムを提案する。
我々のパイプラインは、高度に堅牢でアーティファクトのない再構築を実現し、自動化された4Dアセット生成のための効率的な基盤を提供する。
論文 参考訳(メタデータ) (2026-06-14T16:36:49Z) - Full-4D: Generating Full-Scope 4D Scenes from a Single-View Video [63.61099683012546]
本稿では,同期マルチビュービデオのデータセットであるRealMV-4Dを紹介する。
次に、新しい融合時間(T)-ビュー(V)アテンション機構によって駆動される多視点ビデオ拡散モデルを訓練する。
実験により,本手法は視覚的忠実度と一貫性の両方において既存手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2026-05-25T06:59:26Z) - Syn4D: A Multiview Synthetic 4D Dataset [92.50132053229817]
モノクロビデオからの動的シーンの3D再構成と追跡は、コンピュータビジョンにおいて重要な課題である。
この制限に対処するために、マルチビュー合成動的シーンであるSyn4Dを紹介する。
Syn4Dの主な特徴は、任意のピクセルを3Dに切り離すことである。
論文 参考訳(メタデータ) (2026-05-06T17:59:55Z) - MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence [50.11889361459544]
人間は視覚に基づく4D空間時間知能で生まれる。
その重要性にもかかわらず、この機能は現在の大規模言語モデル(MLLM)にとって重要なボトルネックであり続けている。
論文 参考訳(メタデータ) (2026-02-28T07:23:36Z) - Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis [53.48281548500864]
Motion 3-to-4は、単一のモノクロビデオから高品質な4Dダイナミックオブジェクトを合成するためのフィードフォワードフレームワークである。
我々のモデルは、コンパクトな動き潜在表現を学習し、フレーム単位の軌道を予測して、時間的コヒーレントな幾何である完全なロバスト性を取り戻す。
論文 参考訳(メタデータ) (2026-01-20T18:59:48Z) - Efficient and Scalable Monocular Human-Object Interaction Motion Reconstruction [19.16200327159635]
汎用ロボットは、多種多様な大規模人間オブジェクト相互作用(HOI)から学習し、現実世界でしっかりと操作する必要がある。
4DHOISOLverは、4DHOI復元問題に対処する新しい,効率的な最適化フレームワークである。
Open4DHOIは、144のオブジェクトタイプと103のアクションの多様なカタログを備えた、新しい大規模4D HOIデータセットである。
論文 参考訳(メタデータ) (2025-11-30T16:21:47Z) - GenHOI: Generalizing Text-driven 4D Human-Object Interaction Synthesis for Unseen Objects [13.830968058014546]
GenHOI は,1) 見えない物体への一般化,2) 高忠実度 4D HOI 配列の合成という2つの主要な目的を達成するための2段階のフレームワークである。
接触認識拡散モデル (ContactDM) を第2段階に導入し, 3D HOI を高密な時間的コヒーレントな 4D HOI 配列にシームレスに補間する。
実験の結果,OMOMODMおよび3D-FUTUREデータセットについて,現状の成果が得られた。
論文 参考訳(メタデータ) (2025-06-18T14:17:53Z) - Diffusion4D: Fast Spatial-temporal Consistent 4D Generation via Video Diffusion Models [116.31344506738816]
高速でスケーラブルな4Dコンテンツ生成のための新しいフレームワーク textbfDiffusion4D を提案する。
ダイナミックな3Dアセットの軌道ビューを合成できる4D対応ビデオ拡散モデルを開発した。
提案手法は, 生成効率と4次元幾何整合性の観点から, 従来の最先端技術を超えている。
論文 参考訳(メタデータ) (2024-05-26T17:47:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。