論文の概要: PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets
- arxiv url: http://arxiv.org/abs/2608.08053v1
- Date: Sat, 08 Aug 2026 10:39:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.625755
- Title: PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets
- Title(参考訳): PhysX-CoT: 単一画像からシミュレーション可能な3Dアセットへの構造化物理推論
- Abstract要約: PhysX-CoTは、明示的に構造化された物理的推論プロセスとして、単一イメージのアセット生成をキャストする。
統一されたプロトコルは、学習したすべてのベースラインを同じバックボーン、データ、凍結したデコーダで再トレーニングする。
Unreal Engine5では、生成されたアセットは、高い妥当性でパースし、衝突し、明瞭にする。
- 参考スコア(独自算出の注目度): 15.09472421787365
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Simulation-ready 3D assets are central to robotics and embodied AI. Generating them from a single image is usually framed as a vision-language model that emits a serialized asset for a decoder to turn into geometry and physical fields, leaving the image-to-3D reasoning implicit. We argue the limiting factor is this output-centric view: part placement and local shape are entangled in one global-coordinate token stream, and the intermediate physical states are never exposed for supervision, conditioning, or verification. PhysX-CoT instead casts single-image asset generation as an explicit structured physical reasoning process, an ordered and machine-parseable trajectory of part-level states covering decomposition, 2D and 3D grounding, relations, coarse geometry, and surface cues that we separately supervise, use to condition geometry, and treat as reward targets. Geometry is factorized so that 3D boxes carry placement and local codes carry shape, and CoT-aligned GRPO optimizes parse validity, grounding, geometry, placement, and physical consistency. Under a unified protocol that retrains all learned baselines on the same backbone, data, and frozen decoder, PhysX-CoT outperforms the closest full-task baseline across geometry, scale, and physical-attribute metrics. Oracle, token-matched, and state-order controls show the explicit states are functional rather than cosmetic, and in Unreal Engine~5 the generated assets parse, collide, and articulate at high validity.
- Abstract(参考訳): シミュレーション可能な3Dアセットは、ロボット工学とAIの具体化の中心である。
単一の画像からそれらを生成する場合、通常は視覚言語モデルとしてフレーム化され、デコーダが幾何学や物理分野に変換するためにシリアライズされた資産を出力し、画像から3Dへの推論を暗黙的に残す。
部分配置と局所形状は1つのグローバル座標トークンストリームに絡み合っており、中間状態は、監督、条件付け、検証のために決して露出されない。
PhysX-CoTは、単一イメージの資産生成を明示的な構造化された物理的推論プロセスとして、分解、2Dおよび3Dグラウンド、関係、粗い幾何学、および我々が別々に監督し、条件幾何学に使用し、報酬目標として扱う部分レベル状態の順序と機械パース可能な軌道として、キャストする。
幾何学は3Dボックスが配置を持ち、局所コードは形状を持ち、CoT準拠のGRPOはパース妥当性、接地、幾何学、配置、物理的整合性を最適化する。
学習したすべてのベースラインを同じバックボーン、データ、凍結したデコーダで再トレーニングする統一されたプロトコルの下で、PhysX-CoTは、幾何学、スケール、物理属性のメトリクスで最も近いフルタスクベースラインを上回っている。
Oracle、トークンマッチング、ステートオーダーコントロールは、化粧品よりも明示的な状態が機能していることを示している。
関連論文リスト
- SNAP3D: Physically Grounded 3D Parts for Assembly from a Single Image [29.13316456176034]
パートアウェアな3D生成は、編集、調音、シミュレーション、製造などのアプリケーションを可能にする。
既存の方法は、有効な物理アセンブリを形成することを保証することなく、視覚的に完全な個々の部品を生成することができる。
物理的に互換性のある幾何学と安定な接続による単一画像の部分認識3D生成を改善するための物理誘導型フレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-11T17:59:31Z) - MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes [0.0]
MV-GELは、自然言語クエリからポリゴンメッシュ上の微細な幾何学的エンティティをローカライズするためのフレームワークである。
GELviewsは、幾何学的CADエンティティの可観測性に基づく視点を優先する、プロンプト条件付きランキングモジュールである。
実験では、顔レベルのIoUが1.7倍、エッジレベルのF1が4.5倍向上した。
論文 参考訳(メタデータ) (2026-06-30T11:46:25Z) - GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation [6.488530751190965]
全体移動操作には移動基地とマニピュレータの調整が必要である。
我々は、シンプルな原理に基づいて構築された、エンドツーエンドの拡散ベースのフレームワークGeoHATを提案する。
ManiSkill-HABシミュレーションベンチマークの実験では、GeoHATが79.3%の成功率を達成した。
論文 参考訳(メタデータ) (2026-06-11T14:25:09Z) - GARDEN: Gravity-Aligned Reconstruction of Disentangled ENvironments from RGB images [61.2170105836525]
本稿では,RGBのみのフレームワークを提案する。このフレームワークは,再構成を物理的に地上に配置したシーンファクタ化として再構成し,構造化されたハイブリッドシーン表現を出力する。
結果として得られる表現は、明示的な剛体と分離された背景を組み合わせることで、視覚的リアリズムを維持しながら直接物理シミュレーションを可能にする。
論文 参考訳(メタデータ) (2026-06-02T17:13:01Z) - Robotic Manipulation is Vision-to-Geometry Mapping ($f(v) \rightarrow G$): Vision-Geometry Backbones over Language and Video Models [65.05130114320734]
一般化可能なロボット制御の基礎は、広く採用されている視覚言語やビデオモデルではなく、視覚幾何学のバックボーンであるべきだと我々は主張する。
本研究では,事前訓練されたネイティブ3次元表現上でのアクション生成を直接条件付きで行うビジョン・ジオメトリ・アクション・モデルを提案する。
具体的には、VGAは従来の言語やビデオのバックボーンを事前訓練された3Dワールドモデルに置き換え、シームレスな視覚と幾何学のマッピングを確立する。
論文 参考訳(メタデータ) (2026-04-14T15:57:16Z) - Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors [61.34273238077091]
本稿では,物体の単一画像からオービタルビデオを生成する新しい手法を提案する。
本手法は,最先端の手法と比較して,視覚的品質,形状リアリズム,多視点整合性を実現している。
論文 参考訳(メタデータ) (2026-04-14T05:35:46Z) - Interact3D: Compositional 3D Generation of Interactive Objects [31.12099147294145]
本稿では,3次元合成オブジェクト間の相互作用を物理的に妥当に生成する新しいフレームワークを提案する。
当社のアプローチは、まず先進的な先進的な先進的手法を活用して、高品質な個人資産をキュレートする。
これらの資産を物理的に構成するために、ロバストな2段階合成パイプラインを導入する。
論文 参考訳(メタデータ) (2026-03-17T03:21:06Z) - PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement [89.35154754765502]
PhyScensisは物理エンジンを動力とするエージェントベースのフレームワークで、物理的に可視なシーン構成を生成する。
本フレームワークは,微粒なテキスト記述や数値パラメータに対する強い制御性を保っている。
実験の結果,本手法はシーンの複雑さ,視覚的品質,身体的精度において,従来の手法よりも優れていた。
論文 参考訳(メタデータ) (2026-02-16T17:55:25Z) - Causal Reasoning Elicits Controllable 3D Scene Generation [35.22855710229319]
CausalStructは3Dシーン生成に因果推論を組み込む新しいフレームワークである。
ノードがオブジェクトや属性を表現する因果グラフを構築し、エッジが因果依存性と物理的制約をエンコードする。
提案手法では,3次元ガウス切削およびスコア蒸留サンプリングにより形状精度とレンダリング安定性を向上し,3次元シーンにおけるオブジェクト配置とレイアウトの誘導にテキストや画像を用いる。
論文 参考訳(メタデータ) (2025-09-18T01:03:21Z) - 3D Part Segmentation via Geometric Aggregation of 2D Visual Features [57.20161517451834]
監督された3D部分分割モデルは、固定されたオブジェクトと部品のセットに合わせて調整されており、それらの転送可能性は、オープンセットの現実世界のシナリオに制限される。
近年、視覚言語モデル(VLM)を多視点レンダリングとテキストプロンプトを用いてオブジェクト部品の識別に活用する研究が進められている。
これらの制約に対処するために,視覚概念から抽出した意味論と3次元幾何学をブレンドし,対象部品を効果的に同定するCOPSを提案する。
論文 参考訳(メタデータ) (2024-12-05T15:27:58Z) - Physically Compatible 3D Object Modeling from a Single Image [109.98124149566927]
単一画像を3次元物理オブジェクトに変換するフレームワークを提案する。
我々のフレームワークは、リコンストラクションプロセスに物理的な互換性を組み込む。
既存の手法よりも3Dモデルの物理的リアリズムを一貫して強化する。
論文 参考訳(メタデータ) (2024-05-30T21:59:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。