論文の概要: GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding
- arxiv url: http://arxiv.org/abs/2607.13454v1
- Date: Wed, 15 Jul 2026 05:27:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.659912
- Title: GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding
- Title(参考訳): GeoAnchor:3次元空間理解のための潜在分解による協調推論
- Authors: Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun,
- Abstract要約: GeoAnchorは、3次元空間関係のためのインターリーブテキストラテント推論フレームワークである。
3次元空間情報を3つの相補的な構成要素に分解する: 物体の接地位置潜時、リレーショナル配向方向潜時、シーン構造における幾何潜時である。
多様な複雑な3D推論タスクの実験により、GeoAnchorは、その有効性と一般化能力を検証して、技術の状態より優れていることが示された。
- 参考スコア(独自算出の注目度): 45.67186918674009
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although multimodal large language models (MLLMs) have achieved remarkable progress, understanding 3D spatial relationships from 2D images remains a critical challenge. Existing methods primarily rely on symbolic text tokens, which inherently lack the fidelity to represent continuous geometric information. While recent methods use latent representations to enhance reasoning, relying on a single latent type cannot adapt to the diversity of spatial tasks, leading to misalignment in complex geometric scenarios. To address these limitations, we propose GeoAnchor, an interleaved text-latent reasoning framework. GeoAnchor decomposes 3D spatial information into three complementary components: position latents for object grounding, direction latents for relational orientation, and geometry latents for scene structure. These components are recombined in a structured space to construct local evidence while capturing global context, enabling dynamic and interpretable reasoning. Furthermore, we introduce a collaborative training strategy that guides the model from local spatial perception to comprehensive 3D understanding. Extensive experiments on diverse and complex 3D reasoning tasks demonstrate that GeoAnchor outperforms the state of the art, validating its effectiveness and generalization capabilities.
- Abstract(参考訳): マルチモーダル大言語モデル(MLLM)は目覚ましい進歩を遂げているが、2次元画像から3次元空間関係を理解することは依然として重要な課題である。
既存の手法は主に記号的テキストトークンに依存しており、これは本質的に連続的な幾何学的情報を表現するための忠実さを欠いている。
最近の手法では推論を強化するために潜在表現を用いるが、単一の潜在型に依存すると空間的なタスクの多様性に適応できないため、複雑な幾何学的シナリオでは不適応が生じる。
このような制約に対処するため、我々はGeoAnchorというインターリーブテキストラテント推論フレームワークを提案する。
GeoAnchorは3次元空間情報を3つの相補的な構成要素に分解する。
これらのコンポーネントは、グローバルコンテキストをキャプチャしながら局所的なエビデンスを構築し、動的かつ解釈可能な推論を可能にするために、構造化された空間に再結合される。
さらに,局所的な空間認識から包括的3次元理解へとモデルを導く協調学習戦略を導入する。
多様な複雑な3D推論タスクに関する広範な実験により、GeoAnchorは最先端技術よりも優れており、その有効性と一般化能力が検証されている。
関連論文リスト
- From Extrinsic to Intrinsic: Geodesic-Guided Representation Learning for 3D Geometric Data [56.41479248637621]
我々は,textbfPreトレーニングのための新しい3D表現学習パラダイムであるtextbfPRISMを紹介した。
PRISMは textbfIntrinsic textbfSurface geodesic textbfMetric を検索して埋め込みを学習する。
提案手法は測地線距離予測において, 良好な精度, 堅牢性, 高効率性を示す。
論文 参考訳(メタデータ) (2026-06-01T13:54:26Z) - Thinking with Geometry: Active Geometry Integration for Spatial Reasoning [68.59084007360615]
我々は,能動的知覚にパラダイム・パッシブ・フュージョンをシフトさせるフレームワークであるGeoThinkerを提案する。
特徴混合の代わりに、GeoThinkerはモデルが内部の推論要求に応じて条件付けられた幾何学的証拠を選択的に検索することを可能にする。
その結果,次世代の空間知能には,空間構造を積極的に統合する能力が不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-02-05T18:59:32Z) - CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence [6.2150701899678635]
CoRe3Dは、意味的および空間的抽象化を共同で操作する統合された3D理解および生成推論フレームワークを導入している。
CoRe3Dは、セマンティック・チェーン・オブ・セマンティック・チェーン・推論と構造的空間的推論を密結合することにより、強い局所的な一貫性と言語記述との忠実な整合性を示す3D出力を生成する。
論文 参考訳(メタデータ) (2025-12-14T17:05:11Z) - UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents [21.86068927019046]
分解可能で構造化された3D合成を必要とするアプリケーションには、部分レベル3D生成が不可欠である。
既存の手法では、粒度制御の制限のある暗黙的な部分のセグメンテーションに依存するか、あるいは大きな注釈付きデータセットでトレーニングされた強力な外部セグメンタに依存する。
画像誘導部分レベル3D生成のための2段階遅延拡散フレームワークUniPartを紹介する。
論文 参考訳(メタデータ) (2025-12-10T09:04:12Z) - 3dSAGER: Geospatial Entity Resolution over 3D Objects (Technical Report) [7.378893412842889]
3dSAGERは3Dオブジェクト上の空間的エンティティ解決のためのエンドツーエンドパイプラインである。
本稿では,マッチングペアの複雑な幾何学的特徴をキャプチャする,空間参照非依存のデファクトチュール化機構を提案する。
また、訓練されたモデルを活用して、ハイリコール候補セットを効率的に生成する、軽量で解釈可能な新しいブロッキング手法であるBKAFIを提案する。
論文 参考訳(メタデータ) (2025-11-09T09:35:45Z) - Spatial Reasoner: A 3D Inference Pipeline for XR Applications [0.0]
本稿では,記号的述語と関係性で幾何学的事実をブリッジする空間的推論フレームワークを提案する。
その基礎は、空間的述語集合によって強化された、向き付けられた3D境界ボックス表現に依存している。
導出した述語は空間知識グラフを形成し、パイプラインベースの推論モデルと組み合わせることで、空間クエリと動的ルール評価を可能にする。
論文 参考訳(メタデータ) (2025-04-25T14:27:27Z) - GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary 3D Object Affordance Grounding [53.42728468191711]
Open-Vocabulary 3D object affordance groundingは、任意の命令で3Dオブジェクト上のアクション可能性の領域を予測することを目的としている。
GREAT (GeometRy-intEntion collAboraTive Inference) を提案する。
論文 参考訳(メタデータ) (2024-11-29T11:23:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。