論文の概要: ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation
- arxiv url: http://arxiv.org/abs/2607.28581v1
- Date: Thu, 30 Jul 2026 17:40:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.703544
- Title: ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation
- Title(参考訳): ROAD:3次元形状生成のための識別意味論の相互目的アライメント
- Abstract要約: 高忠実度3D生成は、主にスケールするモデルの容量とデータに依存しており、計算コストは禁じられている。
本稿では,リッチな識別前処理を拡散トランスフォーマーに転送することで,3次元生成のトレーニングコストを削減するフレームワークであるROADを提案する。
- 参考スコア(独自算出の注目度): 45.994649767367044
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-fidelity 3D generation predominantly relies on scaling model capacity and data, which incurs prohibitive computational costs. This paradigm typically requires learning geometry from scratch and overlooks the rich semantic and structural priors already encapsulated in discriminative 3D foundation models. We contend that leveraging the profound understanding of the 3D world possessed by these discriminative models can significantly reduce generative cost. To this end, we propose ROAD, a framework that reduces the training cost of 3D generation by transferring these rich discriminative priors into diffusion transformers. To address the inherent semantic-structural heterogeneity between generative and discriminative latents, we introduce a reciprocal-objective alignment strategy. This method synergizes Holistic Semantic Condensing to enforce global semantic coherence and Structural Optimal Alignment, which is formulated as a bipartite matching problem to rigorously align microscopic geometric details between disparate latent spaces. The 3D foundation model is only used for training-time supervision of alignment and is not used at inference, incurring no additional inference cost. Compared with the industrial baseline Step1X-3D, the proposed ROAD achieves highly competitive generation performance with only 1.5% of the training data and significantly reduces training costs, effectively reducing the computational overhead of high-fidelity 3D generation. Code is available at https://github.com/H-EmbodVis/ROAD.
- Abstract(参考訳): 高忠実度3D生成は、主にスケールするモデルの容量とデータに依存しており、計算コストは禁じられている。
このパラダイムは通常、スクラッチから幾何学を学ぶことを必要とし、差別的な3D基礎モデルにカプセル化されているリッチな意味と構造的先行性を見落としている。
これらの識別モデルが持つ3D世界の深い理解を活用することで、生成コストを大幅に削減できると我々は主張する。
この目的のために,これらのリッチな識別先を拡散変圧器に転送することで,3次元生成のトレーニングコストを低減するフレームワークであるROADを提案する。
生成的および識別的潜伏者間の固有の意味的・構造的不均一性に対処するために,相互対象アライメント戦略を導入する。
この方法は,大域的意味的コヒーレンスと構造的最適アライメントを強制するために,ホロスティックセマンティック・コンデンシングを相乗化し,両部マッチング問題として定式化し,異なる潜在空間間で光学的詳細を厳密に整合させる。
3Dファウンデーションモデルはアライメントのトレーニング時間管理にのみ使用され、推論には使用されず、追加の推論コストは発生しない。
工業用ベースラインのStep1X-3Dと比較して、ROADはトレーニングデータのわずか1.5%で高い競争性能を達成し、トレーニングコストを大幅に削減し、高忠実度3D生成の計算オーバーヘッドを効果的に低減する。
コードはhttps://github.com/H-EmbodVis/ROADで入手できる。
関連論文リスト
- LoST: Level of Semantics Tokenization for 3D Shapes [50.847769883816085]
State-of-the-artメソッドは、もともとレンダリングと圧縮のために設計された幾何学的なレベル・オブ・ディテール(LoD)階層に依存している。
本稿では,初期接頭辞が完全かつ可塑性な形状をデコードするように,サリエンスを指示するレベル・オブ・セマンティックス・トークン化(LoST)を提案する。
LoSTはSOTA再構成を実現し、幾何的および意味的再構成のメトリクスにおいて、従来のLoDベースの3次元形状トークン化器を大きなマージンで上回っている。
論文 参考訳(メタデータ) (2026-03-18T17:56:06Z) - FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation [50.71369329585773]
フェースレベルでメッシュを生成する新しいAutoregressive AutoencoderフレームワークであるFACEを紹介する。
当社のワンフェイスワンツーケン戦略は、メッシュの基本構築ブロックである三角形の面を、単一の統一トークンとして扱います。
FACEは、標準ベンチマークで最先端の再構築品質を達成する。
論文 参考訳(メタデータ) (2026-03-02T06:47:15Z) - PnP-U3D: Plug-and-Play 3D Framework Bridging Autoregression and Diffusion for Unified Understanding and Generation [45.72473673810981]
本稿では,自己回帰と拡散を組み合わせた3次元理解・生成のための最初の統合フレームワークを提案する。
軽量トランスは、大きな言語モデルの特徴空間と3次元拡散モデルの条件空間を橋渡しする。
本フレームワークは,多種多様な3次元理解および生成ベンチマークにおける最先端性能を実現するとともに,3次元編集タスクにも優れる。
論文 参考訳(メタデータ) (2026-02-03T13:49:23Z) - GEAL: Generalizable 3D Affordance Learning with Cross-Modal Consistency [50.11520458252128]
既存の3Dアベイランス学習手法は、注釈付きデータに制限があるため、一般化と堅牢性に苦慮している。
本稿では,大規模事前学習型2Dモデルを活用することで,3次元アベイランス学習の一般化と堅牢性を高めるための新しいフレームワークであるGEALを提案する。
GEALは、既存のメソッドと、新しいオブジェクトカテゴリ、および破損したデータにおいて、一貫して優れています。
論文 参考訳(メタデータ) (2024-12-12T17:59:03Z) - Pushing Auto-regressive Models for 3D Shape Generation at Capacity and Scalability [118.26563926533517]
自己回帰モデルでは,格子空間における関節分布をモデル化することにより,2次元画像生成において顕著な結果が得られた。
自動回帰モデルを3次元領域に拡張し,キャパシティとスケーラビリティを同時に向上することにより,3次元形状生成の強力な能力を求める。
論文 参考訳(メタデータ) (2024-02-19T15:33:09Z) - FILP-3D: Enhancing 3D Few-shot Class-incremental Learning with Pre-trained Vision-Language Models [59.13757801286343]
クラス増分学習(class-incremental learning)は、モデルが限られたデータで漸進的にトレーニングされている場合、破滅的な忘れの問題を軽減することを目的としている。
本稿では,特徴空間の不整合のための冗長特徴除去器 (RFE) と,重要な雑音に対する空間ノイズ補償器 (SNC) の2つの新しいコンポーネントを備えたFILP-3Dフレームワークを紹介する。
論文 参考訳(メタデータ) (2023-12-28T14:52:07Z) - Self-supervised Learning for Enhancing Geometrical Modeling in 3D-Aware
Generative Adversarial Network [42.16520614686877]
3D-GANは、メッシュの不完全性や穴などの3D幾何学的モデリングにおいて、アーティファクトを示す。
これらの欠点は、主にアノテーション付き3Dデータの可用性が制限されているためである。
本稿では,任意の3D-GANの補助的損失を補うセルフ・スーパーバイザード・ラーニング手法を提案する。
論文 参考訳(メタデータ) (2023-12-19T04:55:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。