論文の概要: CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval
- arxiv url: http://arxiv.org/abs/2607.19115v1
- Date: Tue, 21 Jul 2026 13:59:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.439736
- Title: CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval
- Title(参考訳): CR-Refiner:3次元画像検索のためのオブジェクト中心の最適輸送リランカ
- Abstract要約: 編集条件付き3Dシーン検索は、自然言語修正による参照3Dルームをペアにし、編集を満足するコーパスから部屋を検索する。
CR-Refinerは、ベースレトリバーのトップK候補を3つのコンポーネントでラップするトレーニング不要のリランカである。
3Dオブジェクトセットに対するコンポジションマッチングを評価するベンチマークは存在しないため、3D-CER,4,963の編集条件付きクエリを23,381室の屋内コーパス上でリリースする。
- 参考スコア(独自算出の注目度): 17.691372618971844
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Edit-conditioned 3D scene retrieval pairs a reference 3D room with a natural-language modification and retrieves rooms from a corpus that satisfy the edit. Three lines of prior work each fall short on this task. 2D composed image retrieval reasons over pixel-level edits and has no primitive for 3D object sets. 3D foundation encoders embed individual objects but cannot compose at the scene level. 3D scene-grounding methods localize references inside a static scene rather than rank modified rooms across a corpus. We present CR-Refiner, a training-free reranker that wraps any base retriever's top-K candidates with three components. A frozen LLM parses the edit into a structured query entity, and each candidate is scored by an unbalanced optimal-transport problem over a 1xG cost matrix coupling category, style, material, and geometry. The unbalanced solver lets the single-entity query drop mass on irrelevant objects, modelling the asymmetry directly. An axis-conditional structural prior adds size-keyword cues for geometric edits and subject-anchor direction cues for spatial edits. An LLM verifier refines the top three candidates with continuous confidence. Because no benchmark evaluates compositional matching over 3D object sets, we additionally release 3D-CER, 4,963 edit-conditioned queries over a 23,381-room indoor corpus across five edit axes, with multi-positive ground truth, CIRR-style hard subsets, and zero-target adversarials. Across three qualitatively distinct base retrievers, CR-Refiner consistently improves hard-subset R@1 and mAP@10 on every edit axis.
- Abstract(参考訳): 編集条件付き3Dシーン検索は、自然言語修正による参照3Dルームをペアにし、編集を満足するコーパスから部屋を検索する。
3行の事前作業はこのタスクでそれぞれ不足しています。
2Dは、ピクセルレベルの編集よりも画像検索の理由を合成し、3Dオブジェクトセットのプリミティブを持たない。
3Dファウンデーションエンコーダは個々のオブジェクトを埋め込むが、シーンレベルでは構成できない。
3次元シーングラウンド法は、コーパスを横断する階調変更室ではなく、静的シーン内の参照をローカライズする。
CR-Refinerは、ベースレトリバーのトップK候補を3つのコンポーネントでラップするトレーニング不要のリランカである。
凍結LDMは、編集を構造化されたクエリエンティティに解析し、各候補は、1xGコスト行列結合カテゴリ、スタイル、材料、幾何学上の不均衡な最適輸送問題によってスコアされる。
アンバランスな解法は、非対称を直接モデル化して、無関係なオブジェクトに単一エンテントクエリの質量を落とすことを可能にする。
軸条件構造先行は、幾何学的編集のためのサイズキーワードキューと空間的編集のための主観的アンカー方向キューを付加する。
LLM検証器は、連続した自信を持って上位3つの候補を洗練する。
3Dオブジェクトセットに対するコンポジションマッチングを評価できないため、3D-CER,4,963の編集条件付きクエリを5つの編集軸にわたる23,381室の屋内コーパスでリリースする。
CR-Refinerは3つの定性的に異なるベースレトリバーに対して、編集軸ごとにハードサブセットR@1とmAP@10を一貫して改善する。
関連論文リスト
- Procedura: Agentic 3D Modeling with Procedural Control [52.232812096564906]
Proceduraは、オブジェクトを手続き的なアセンブリとして記述する、新しい3Dモデリングエージェントフレームワークである。
テキストプロンプトから、エージェントはアセンブリグラフとしてオブジェクトを計画し、プログラム部分を部分的に書きます。
分離された視覚評論家は、一度に診断された修正を精製する。
論文 参考訳(メタデータ) (2026-08-26T17:54:39Z) - SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs [20.639795141272394]
3Dオブジェクトグラウンドは、自然言語から参照オブジェクトを3Dシーンにローカライズする。
統一インスタンス中心の3D-LLMは、ダイアログ、QA、キャプションと共にグラウンド化を解決することを目的としている。
統一3D-LLMのための構造的接地インタフェースである構造的空間共振3D-LLMを提案する。
論文 参考訳(メタデータ) (2026-05-27T13:45:34Z) - Robust Prior-Guided Segmentation for Editable 3D Gaussian Splatting [6.290910602456353]
2Dセグメンテーションを3Dドメインに持ち上げる既存のアプローチは、視界の不整合と粗いマスクに悩まされている。
本稿では,Segment Anything Model High Qualityを利用して正確な2次元マスクを生成する新しいフレームワークを提案する。
提案手法は最先端のセグメンテーション精度を実現し,高視力を維持しながらインタラクティブなリアルタイムオブジェクト編集を可能にする。
論文 参考訳(メタデータ) (2026-05-15T15:29:30Z) - OCH3R: Object-Centric Holistic 3D Reconstruction [36.45885767128656]
我々は1枚のRGB画像からオブジェクト中心のホロスティック3次元再構成のための統合フレームワークであるOCH3Rを紹介する。
OCH3Rは1つのフォワードパスを実行し、すべてのオブジェクトインスタンスを同時に6Dポーズと詳細な3D再構成で予測する。
標準的な屋内ベンチマークでは、OCH3Rは単分子深度推定、開語彙セマンティックセマンティックセグメンテーション、RGBのみのカテゴリレベルの6Dポーズ推定にまたがって最先端の性能を達成する。
論文 参考訳(メタデータ) (2026-05-13T05:17:51Z) - Error-Driven Scene Editing for 3D Grounding in Large Language Models [71.41120775319088]
近年の3D-LLMの進歩にもかかわらず、3D環境における視覚的および空間的要素に正確に接地する言語に限られている。
この制限は、3Dリソースの不足による空間的理解よりも、言語推論に焦点を当てたトレーニングデータに起因している。
本稿では,これらのバイアスを緩和する正確な視覚的カウンターファクトを生成するための重要なメカニズムとして,3Dシーン編集を提案する。
論文 参考訳(メタデータ) (2025-11-18T03:13:29Z) - 3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection [62.57179069154312]
最初のエンドツーエンド3Dモノクロオープンセットオブジェクト検出器(3D-MOOD)を紹介する。
私たちはオープンセットの2D検出を設計した3Dバウンディングボックスヘッドを通して3D空間に持ち上げます。
対象クエリを事前に幾何学的に条件付けし,様々な場面で3次元推定の一般化を克服する。
論文 参考訳(メタデータ) (2025-07-31T13:56:41Z) - 3D Video Object Detection with Learnable Object-Centric Global
Optimization [65.68977894460222]
対応性に基づく最適化は3次元シーン再構成の基盤となるが、3次元ビデオオブジェクト検出では研究されていない。
オブジェクト中心の時間対応学習と特徴量付きオブジェクトバンドル調整を備えた、エンドツーエンドで最適化可能なオブジェクト検出器であるBA-Detを提案する。
論文 参考訳(メタデータ) (2023-03-27T17:39:39Z) - Point2Seq: Detecting 3D Objects as Sequences [58.63662049729309]
我々は、ポイントクラウドから3次元オブジェクトを検出するためのシンプルで効果的なフレームワーク、Point2Seqを提案する。
我々は,各3Dオブジェクトを単語列とみなし,その3Dオブジェクト検出タスクを,自動回帰的に3Dシーンからの単語の復号化として再構成する。
論文 参考訳(メタデータ) (2022-03-25T00:20:31Z) - DensePose 3D: Lifting Canonical Surface Maps of Articulated Objects to
the Third Dimension [71.71234436165255]
DensePose 3Dは2次元画像アノテーションのみから弱い教師付きで再構築を学習できる手法である。
3Dスキャンを必要としないため、DensePose 3Dは異なる動物種などの幅広いカテゴリーの学習に利用できる。
我々は,人間と動物のカテゴリーの合成データと実データの両方をベースラインとして,最先端の非剛体構造と比較し,顕著な改善を示した。
論文 参考訳(メタデータ) (2021-08-31T18:33:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。