論文の概要: PWM-ArtGen: Part World Model for Articulated Object Generation
- arxiv url: http://arxiv.org/abs/2607.02045v1
- Date: Thu, 02 Jul 2026 11:12:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.800607
- Title: PWM-ArtGen: Part World Model for Articulated Object Generation
- Title(参考訳): PWM-ArtGen:Part World Model for Articulated Object Generation
- Authors: Wentao Zheng, Ancong Wu,
- Abstract要約: 単一画像からの3Dオブジェクト生成における鍵となる課題は、基礎となる運動構造を正確に予測することである。
既存の手法では、動的部分レベルのキネマティックな関係を持たない静的な画像から直接キネマティックなパラメータを推測するか、あるいは単一の画像から生成された視覚力学からパラメータを推定する。
視覚力学と運動パラメータの連成分布を学習し、ArtGenと呼ばれる統一されたパートワールドモデルを提案する。
- 参考スコア(独自算出の注目度): 12.959451816311129
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The key challenge in articulated 3D object generation from a single image is accurately predicting the underlying kinematic structure. Existing methods either infer kinematic parameters directly from a static image that lacks dynamic part-level kinematic relationships, or estimate parameters from visual dynamics generated from a single image, which is prone to accumulated errors of two steps. Moreover, the limited scale and diversity of existing annotated datasets further hinder generalization to complex, real-world objects. To overcome these limitations, we propose to learn the joint distribution of visual dynamics and kinematic parameters. Recognizing that articulated objects can be formulated as dynamic systems, we propose a unified Part World Model called PWM-ArtGen. To leverage unannotated data, this model couples action diffusion and image diffusion with independent diffusion timesteps, which enables visual branch co-training. We further curate a photorealistic dataset of 19.7k part-level image pairs without kinematic annotations, to support co-training. Experiments demonstrate that PWM-ArtGen substantially outperforms existing baselines in the resting state and exhibits strong zero-shot generalization to out-of-distribution objects.
- Abstract(参考訳): 単一画像からの3次元オブジェクト生成における鍵となる課題は、基礎となる運動構造を正確に予測することである。
既存の手法では、動的部分レベルの運動的関係が欠如している静的イメージから直接動力学的パラメータを推定するか、単一の画像から生成された視覚力学からパラメータを推定する。
さらに、既存の注釈付きデータセットのスケールと多様性の制限により、複雑な現実世界のオブジェクトへの一般化はさらに妨げられる。
これらの制約を克服するために,視覚力学と運動パラメータの連立分布を学習することを提案する。
そこで我々はPWM-ArtGenと呼ばれる統一されたパートワールドモデルを提案する。
非注釈データを活用するために、このモデルはアクション拡散とイメージ拡散を独立拡散時間ステップと結合し、視覚枝の協調訓練を可能にする。
さらに、協調学習を支援するために、キネマティックアノテーションを使わずに19.7kのパートレベルの画像ペアのフォトリアリスティックデータセットをキュレートする。
実験により、PWM-ArtGenは静止状態において既存のベースラインを大幅に上回り、分布外オブジェクトに対して強いゼロショットの一般化を示すことが示された。
関連論文リスト
- MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling [55.72785604682579]
MMPhysVideoは、共同マルチモーダルモデリングにおけるビデオ生成における物理的可視性を拡大するフレームワークである。
MMPhysVideoは、様々なベンチマークで高度なモデルよりも、物理的な可視性と視覚的品質を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-03T07:32:24Z) - ArtGen: Conditional Generative Modeling of Articulated Objects in Arbitrary Part-Level States [9.721009445297716]
ArtGenは、正確な幾何学とコヒーレント・キネマティクスを備えた3Dオブジェクトを生成することができる条件付き拡散ベースのフレームワークである。
具体的には、ArtGenはグローバルキネマティック一貫性を明示的に実施するために、クロスステートなMonte Carloサンプリングを使用している。
合成3D-VAE潜伏剤は局所的言語的注意に先行して強化され、微細な幾何学的関係と大域的部分的関係を効果的に捉える。
論文 参考訳(メタデータ) (2025-12-13T17:00:03Z) - Dynamic Avatar-Scene Rendering from Human-centric Context [75.95641456716373]
分離されたモデルと最適化されたモデルをブリッジするbf分離マップ(StM)戦略を提案する。
StMは、視覚的品質とレンダリングの精度の両方において、既存の最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-11-13T17:39:06Z) - DIPO: Dual-State Images Controlled Articulated Object Generation Powered by Diverse Data [67.99373622902827]
DIPOは、一対のイメージから調音された3Dオブジェクトを制御可能な生成するためのフレームワークである。
本稿では,イメージペア間の関係を捉え,部分配置と関節パラメータを生成するデュアルイメージ拡散モデルを提案する。
複雑な3Dオブジェクトの大規模データセットであるPM-Xについて,レンダリング画像,URDFアノテーション,テキスト記述を伴って提案する。
論文 参考訳(メタデータ) (2025-05-26T18:55:14Z) - PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM [17.554471769834453]
一つの画像から物理的に一貫した動きを生成するトレーニング不要のフレームワークであるPhyMAGICを提案する。
PhyMAGICは、事前訓練された画像間拡散モデル、LDMによる信頼誘導推論、微分可能な物理シミュレータを統合する。
総合的な実験により、PhyMAGICは最先端のビデオジェネレータや物理対応のベースラインより優れていることが示された。
論文 参考訳(メタデータ) (2025-05-22T09:40:34Z) - DiffusionSfM: Predicting Structure and Motion via Ray Origin and Endpoint Diffusion [53.70278210626701]
マルチビュー画像から3次元シーン形状とカメラポーズを直接推定するデータ駆動型マルチビュー推論手法を提案する。
我々のフレームワークであるDiffusionSfMは、シーン幾何学とカメラを、グローバルフレーム内のピクセルワイズ線源とエンドポイントとしてパラメータ化します。
我々は、DiffusionSfMを合成データセットと実データセットの両方で実証的に検証し、古典的および学習ベースのアプローチよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-05-08T17:59:47Z) - Learning Monocular Depth in Dynamic Scenes via Instance-Aware Projection
Consistency [114.02182755620784]
本稿では,複数の動的物体の6-DoF動作,エゴモーション,深度を,監督なしで一眼レフカメラで明示的にモデル化する,エンドツーエンドのジョイントトレーニングフレームワークを提案する。
筆者らのフレームワークは,最先端の深度・動き推定法より優れていた。
論文 参考訳(メタデータ) (2021-02-04T14:26:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。