論文の概要: I2CD: Direct Image-to-Convex Decomposition for Simulation-Ready Collision Geometry
- arxiv url: http://arxiv.org/abs/2610.03453v1
- Date: Fri, 02 Oct 2026 15:32:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.453891
- Title: I2CD: Direct Image-to-Convex Decomposition for Simulation-Ready Collision Geometry
- Title(参考訳): I2CD:シミュレーション可能な衝突幾何学のための直接画像対凸分解
- Abstract要約: I2CDは単一のRGB画像から直接凸分解を予測する。
I2CDはプランナー対応のオブジェクトを11ドル、最強のベースラインは328ドルで製造する。
IoUは8つの再構成済みの分解パイプラインのうち、6ドルから37ドル、より高速なエンドツーエンドで実行している。
- 参考スコア(独自算出の注目度): 6.101776600532684
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Physics simulators and motion planners require convex collision geometry, yet image-to-3D generative models output dense, frequently non-manifold visual meshes. Bridging the two today takes a slow, brittle reconstruct-then-decompose pipeline of repair, decimation, and approximate convex decomposition. We present I2CD, which predicts a convex decomposition directly from a single RGB image. Rather than train a new image-to-3D model, I2CD freezes the pretrained Hunyuan3D-2 image-conditioned diffusion transformer and shape decoder and trains only a lightweight cross-attention head (38M parameters, under ten GPU-hours) whose learned "convex-slot" tokens emit the halfplane parameters of $K$ convex polytopes. The output is compact, convex by construction, and loads into physics engines without any post-processing, in ${\sim}0.5$s per image. On $227$ held-out OmniObject3D and Google Scanned Objects instances, I2CD attains the highest volumetric IoU among eight reconstruct-then-decompose pipelines while running $6$-$37\times$ faster end-to-end. In a cross-simulator study in MuJoCo, PyBullet, Genesis, and Isaac Sim, every engine uses I2CD geometry as delivered, whereas raw generated meshes "load" everywhere but are silently replaced by a different collision shape in most cases or need seconds to minutes of per-object preprocessing. On a physical xArm7, I2CD produces planner-ready geometry for a $20$-object cluttered scene in $11$s versus $328$s for the strongest baseline, at comparable pick-and-place execution success ($85$ vs. $90$ of $100$ trials).
- Abstract(参考訳): 物理シミュレータとモーションプランナーは凸衝突幾何学を必要とするが、画像から3D生成モデルは密度が高く、しばしば非マニフォールドの視覚メッシュを出力する。
今日この2つをブリッジするには、修理、デシメーション、および近似凸分解の緩やかで脆い再構築パイプラインが必要である。
本稿では,単一のRGB画像から直接凸分解を予測するI2CDを提案する。
新しい画像から3Dモデルを訓練する代わりに、I2CDは訓練済みのHunyuan3D-2イメージコンディショニングトランスフォーマーと形状デコーダを凍結し、学習した「凸スロット」トークンがコンベックスポリトップの半平面パラメータを出力する軽量なクロスアテンションヘッド(38Mパラメータ、GPU時間以下)のみを訓練する。
出力はコンパクトで、構成によって凸であり、後処理なしで物理エンジンにロードされ、1枚あたり${\sim}0.5$sである。
OmniObject3DとGoogle Scanned Objectsの227ドル(約2万2000円)で、I2CDは8つの再構成済み分解パイプラインの中で最高容量のIoUを達成し、6ドルから37ドル(約6万2000円)の高速エンド・ツー・エンドを実行した。
MuJoCo、PyBullet、Genesis、Isaac Simのクロスシミュレーターによる研究では、全てのエンジンはI2CDの形状を届けるが、生のメッシュは至る所でロードされるが、ほとんどの場合、異なる衝突形態に置き換えられる。
物理的なxArm7で、I2CDは20ドル(約2万2000円)の粗いシーンを、最強のベースラインで328ドル(約3万2000円)で1ドル(約1万2000円)で作っている。
関連論文リスト
- OTT3R: Multi-View 3D Reconstruction and Fast Dataset Generation at 1% Compute [2.676349883103404]
OTT3R(RGB-Only Tiny Transformer for 3D Reconstruction)は、3D再構築のための知識蒸留フレームワークである。
擬似ラベルパイプラインは、COLMAPに代わる信頼性の高い高スループットを提供する。
デプロイ可能なアーティファクトはドメイン特化された学生であり、0.2%の計算の専門化の後、7シーンのCOLMAPよりも4$times$正確である。
論文 参考訳(メタデータ) (2026-09-28T23:05:19Z) - Three-Body Scattering for Generative Modeling [17.851305398372794]
本研究では, 適切な分布エネルギーがサンプルレベルの運動を誘導し, 一段階発生器の直接回帰管理を可能にすることを示す。
生成のための3次元散乱モデリングは、エネルギー距離を一定サイズ毎の弾道的相互作用に変換する。
拡散関連監視,ドリフトライクなダイナミクス,およびGANライクな目的に関するデザインマップを提供する。
論文 参考訳(メタデータ) (2026-07-20T17:38:12Z) - Geometrically Consistent Multi-View Scene Generation from Freehand Sketches [58.98194920417429]
フリーハンドスケッチは、マルチビュージェネレータを提供することができる最も幾何学的に不十分な入力である。
学習データの欠如、歪んだ2次元入力からの幾何学的推論の必要性、ビュー間の整合性という3つの複合的な課題に対処する。
本フレームワークは,参照画像,反復的精細化,シーンごとの最適化を必要とせず,単一のデノナイジングプロセスですべてのビューを合成する。
論文 参考訳(メタデータ) (2026-04-15T18:00:45Z) - SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single Images [49.7344030427291]
単一画像の3Dオブジェクト再構成の問題点について検討する。
最近の研究は回帰モデルと生成モデルという2つの方向に分かれている。
両方向を最大限に活用するための新しい2段階アプローチであるSPAR3Dを提案する。
論文 参考訳(メタデータ) (2025-01-08T18:52:03Z) - ArchComplete: Autoregressive 3D Architectural Design Generation with Hierarchical Diffusion-Based Upsampling [0.0]
ArchCompleteはベクトル量子化モデルからなる2段階のボクセルベースの3D生成パイプラインである。
パイプラインのキーとなるのは、(i) 2.5Dの知覚的損失とともに最適化された、ローカルなパッチ埋め込みのコンテキスト的にリッチなコードブックを学習することです。
ArchCompleteは643ドルという解像度で自動回帰的にモデルを生成し、それを5123ドルまで改良する。
論文 参考訳(メタデータ) (2024-12-23T20:13:27Z) - InstantSplat: Sparse-view Gaussian Splatting in Seconds [91.77050739918037]
InstantSplatは,光速でスパークビュー3Dシーンを再現する新しい手法である。
InstantSplatでは,3Dシーン表現とカメラポーズを最適化する,自己管理フレームワークを採用している。
3D-GSの従来のSfMと比較して、30倍以上の再現を達成し、視覚的品質(SSIM)を0.3755から0.7624に改善する。
論文 参考訳(メタデータ) (2024-03-29T17:29:58Z) - XDGAN: Multi-Modal 3D Shape Generation in 2D Space [60.46777591995821]
本稿では,3次元形状をコンパクトな1チャネル幾何画像に変換し,StyleGAN3と画像間翻訳ネットワークを利用して2次元空間で3次元オブジェクトを生成する手法を提案する。
生成された幾何学画像は素早く3Dメッシュに変換し、リアルタイムな3Dオブジェクト合成、可視化、インタラクティブな編集を可能にする。
近年の3次元生成モデルと比較して,より高速かつ柔軟な3次元形状生成,単一ビュー再構成,形状操作などの様々なタスクにおいて,本手法が有効であることを示す。
論文 参考訳(メタデータ) (2022-10-06T15:54:01Z) - EpiGRAF: Rethinking training of 3D GANs [60.38818140637367]
本稿では,SotA画像品質の高い高解像度3Dジェネレータを,パッチワイズを単純に訓練するまったく異なる経路を辿ることによって実現可能であることを示す。
EpiGRAFと呼ばれる結果のモデルは、効率的で高解像度で純粋な3Dジェネレータである。
論文 参考訳(メタデータ) (2022-06-21T17:08:23Z) - Pix2Vox++: Multi-scale Context-aware 3D Object Reconstruction from
Single and Multiple Images [56.652027072552606]
Pix2Vox++という,単一ビューと複数ビューの3Dオブジェクト再構成のための新しいフレームワークを提案する。
良く設計されたエンコーダデコーダを用いて、各入力画像から粗い3Dボリュームを生成する。
次に、マルチスケールコンテキスト対応融合モジュールを導入し、全ての粗い3Dボリュームから異なる部分の高品質な再構成を適応的に選択し、融合した3Dボリュームを得る。
論文 参考訳(メタデータ) (2020-06-22T13:48:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。