論文の概要: UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image
- arxiv url: http://arxiv.org/abs/2606.30608v2
- Date: Tue, 30 Jun 2026 15:31:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.738461
- Title: UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image
- Title(参考訳): UnfoldArt: テキストや画像から完全アーティキュレートされた3Dオブジェクトのゼロショット復元
- Authors: Mohamed el Amine Boudjoghra, Ivan Laptev, Angela Dai,
- Abstract要約: 本稿では,テキストや画像からの3Dオブジェクトの再構成について,議論を巻き起こしたアプローチを提案する。
高レベルのエージェントは、視覚言語やビデオモデルからの知識を用いて、オブジェクトの意味論と動きを推論する。
低レベルエージェントは調音パラメータと相互作用点を推定する。
同じビデオは、合意された調律に条件付けされ、各部分をその動きを通して駆動し、隠された内部と幾何学を露呈する。
- 参考スコア(独自算出の注目度): 58.40343808003224
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Articulated 3D objects are essential for interactive environments in embodied AI, robotics, and virtual reality, but reconstructing their structure and motion from sparse observations remains challenging. Existing approaches remain largely constrained by lack of supervised data or lack the priors needed to reliably recover articulation, hidden geometry, and internal object structure. We present the first debate-driven agentic approach to articulated 3D object reconstruction from text or image inputs that both grounds articulation reasoning in concrete motion and exposes the occluded geometry revealed under articulation. High-level agents reason about object semantics and motion using knowledge from vision-language and video models, while low-level agents estimate articulation parameters and interaction points; together, they engage in a two-round structured debate that first exploits global--local disagreement and then grounds the agents in freely generated video. The same video prior, conditioned on the agreed articulation, then drives each part through its motion to expose occluded interiors and geometry that cannot be inferred from a single static view. By combining agentic reasoning with a video generative prior, our approach jointly infers articulation and reconstructs complete 3D articulated objects, producing high-fidelity geometry, internal structure, and motion-consistent states beyond directly observed surfaces.
- Abstract(参考訳): 人工的な3Dオブジェクトは、具体化されたAI、ロボティクス、バーチャルリアリティーにおいてインタラクティブな環境に不可欠なものだが、その構造と動きをスパース観測から再構築することは依然として困難である。
既存のアプローチは、教師付きデータの欠如や、調音、隠れた幾何学、内部のオブジェクト構造を確実に回復するために必要な事前の欠如によって、大きな制約が残されている。
テキストや画像入力から3次元オブジェクトを抽出し, 具体的動作に起因した構図を提示し, 具体的動作下での隠蔽形状を露呈する, 最初の議論駆動型エージェント的アプローチを提案する。
高レベルのエージェントは、視覚言語とビデオモデルからの知識を用いてオブジェクトの意味論と動きを推論し、低レベルのエージェントは、調音パラメータと相互作用ポイントを推定する。
同じビデオは、合意された調律に条件付けされ、各部分をその動きを通して駆動し、単一の静的な視点から推測できない隠蔽された内部と幾何学を露呈する。
エージェント推論とビデオ生成前処理を組み合わせることで, 直接観察された面を超えて, 高忠実度な形状, 内部構造, 動きに一貫性のある状態を生成することによって, 完全な3次元明瞭度オブジェクトを共同で推論し, 再構成する。
関連論文リスト
- MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction [47.69179070489671]
単一の画像から明瞭な3Dオブジェクトを再構成するには、限られた視覚的証拠からオブジェクト形状、部分構造、運動パラメータを共同で推測する必要がある。
画像特徴から直接調音を予測するのではなく, 視覚的観察を標準幾何学, 構造的部分表現, 動き認識を単一のアーキテクチャに組み込む, 統合されたフレームワークであるMonoArtを提案する。
論文 参考訳(メタデータ) (2026-03-19T17:59:52Z) - Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints [21.83046776294786]
Articulat3Dは、カジュアルにキャプチャされたモノクロビデオからデジタルツインを構築する新しいフレームワークである。
まず,3次元の軌跡を利用して調音運動の低次元構造を利用する動き優先初期化を提案する。
次に、物理的に可算な調音を強制する幾何学的・運動的制約(Geometric and Motion Constraints Refinement)を導入する。
実験により、Articulat3Dは、合成ベンチマークと現実世界のカジュアルにキャプチャされたモノクロビデオで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-03-12T06:59:44Z) - ArtHOI: Articulated Human-Object Interaction Synthesis by 4D Reconstruction from Video Priors [51.06020148149403]
ビデオ先行画像からの4D再構成による人-物間相互作用合成のための最初のゼロショットフレームワークであるArtHOIを紹介する。
ArtHOIは、ビデオベースの生成と幾何学的認識の再構築をブリッジし、セマンティックアライメントと物理的基盤の両方のインタラクションを生成する。
論文 参考訳(メタデータ) (2026-03-04T17:58:04Z) - TeHOR: Text-Guided 3D Human and Object Reconstruction with Textures [53.21603129469796]
単一の画像から3次元の人間と物体を共同で再構成することは、ロボット工学やデジタルコンテンツ制作において重要な応用例となる、活発な研究領域である。
既存のアプローチは物理的接触情報に大きく依存しており、非接触的な人間と物体の相互作用を捉えることはできない。
本稿では,2つのコア設計に基づくフレームワークTeHORを紹介する。まず,人間とオブジェクトの相互作用のテキスト記述を活用し,セマンティックアライメントを強制する。
第2に、3次元人間と物体の外観の手がかりをアライメントプロセスに組み込んで、全体的文脈情報をキャプチャする。
論文 参考訳(メタデータ) (2026-02-23T10:22:52Z) - Object Reconstruction under Occlusion with Generative Priors and Contact-induced Constraints [20.702086497025494]
本稿では、視覚信号のあいまいさを軽減するために、2つの余分な情報源を利用する。
まず、生成モデルは、よく見られる物体の形状の先行を学習し、幾何学の見当たらない部分について合理的な推測をすることができる。
第二に、ビデオと物理的相互作用から得られる接触情報は、幾何学の境界にスパース制約を与える。
論文 参考訳(メタデータ) (2025-12-04T18:45:14Z) - VideoArtGS: Building Digital Twins of Articulated Objects from Monocular Video [60.63575135514847]
モノクロビデオから音声化されたオブジェクトのデジタルツインを構築することは、コンピュータビジョンにおいて重要な課題である。
本稿では,モノクロ映像から高忠実度デジタル双対を再構成する新しい手法であるVideoArtGSを紹介する。
VideoArtGSは、調音およびメッシュ再構成における最先端性能を示し、既存の方法に比べて約2桁の再現誤差を低減している。
論文 参考訳(メタデータ) (2025-09-22T11:52:02Z) - Betsu-Betsu: Multi-View Separable 3D Reconstruction of Two Interacting Objects [67.96148051569993]
本稿では, 近接相互作用中の2つの物体の形状と外観を再構成し, 両者を3次元で解離させるニューロ・インシシシット法を提案する。
フレームワークはエンドツーエンドのトレーニングが可能で、新しいアルファブレンディング正規化を使用して管理されている。
我々は,人間と物体の密接な相互作用からなる新しいデータセットを導入するとともに,武道を行う人間の2つの場面について評価する。
論文 参考訳(メタデータ) (2025-02-19T18:59:56Z) - GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary 3D Object Affordance Grounding [53.42728468191711]
Open-Vocabulary 3D object affordance groundingは、任意の命令で3Dオブジェクト上のアクション可能性の領域を予測することを目的としている。
GREAT (GeometRy-intEntion collAboraTive Inference) を提案する。
論文 参考訳(メタデータ) (2024-11-29T11:23:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。