論文の概要: CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models
- arxiv url: http://arxiv.org/abs/2607.06534v1
- Date: Tue, 07 Jul 2026 17:39:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.612002
- Title: CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models
- Title(参考訳): CAIRN: トポロジーを考慮した大規模マルチモーダルモデルによるクロスルーム3次元シーン理解
- Authors: He Liang, Chenyang Ma, Yiming Zhang, Sangyun Shin, Andrew Markham, Niki Trigoni, Yuhang He,
- Abstract要約: CAIRNは、マルチルーム3Dシーン理解のためのトポロジー対応の3D-LLMである。
マルチルーム3Dシーン理解のためのHM3DのベンチマークであるCAIRN-MR上で開発された。
- 参考スコア(独自算出の注目度): 52.05338941273686
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing 3D scene-grounded Large Language Models (3D-LLMs) focus on answering questions grounded in simplified single-room 3D scenes, lacking the ability to reason over real-world household environments containing multiple interconnected rooms and diverse object categories. We introduce CAIRN, a topology-aware 3D-LLM for multi-room 3D scene understanding. CAIRN aligns transformer attention with scene hierarchy, giving the model explicit awareness of object-level relations and room-level connectivity. It enriches object tokens with room-local relational context via a graph neural network, introduces learned room tokens for room-level abstraction, and applies a hierarchical attention mask with geometric bias to route information according to scene topology. CAIRN is developed on CAIRN-MR, a benchmark we introduce on HM3D for multi-room 3D scene understanding, covering grounding, captioning, and four question-answering tasks that progressively evaluate from intra-room perception to cross-room reasoning. Experiments show that CAIRN outperforms prior 3D-LLMs by a large margin across all CAIRN-MR tasks while remaining competitive on five single-room benchmarks.
- Abstract(参考訳): 既存の3Dシーンの大規模言語モデル(3D-LLMs)は、単純化された1室の3Dシーンに根ざした質問に答えることに重点を置いている。
マルチルーム3Dシーン理解のためのトポロジ対応3D-LLMであるCAIRNを紹介する。
CAIRNはトランスフォーマーの注意をシーン階層と一致させ、モデルがオブジェクトレベルの関係とルームレベルの接続性を明確に認識することを可能にする。
グラフニューラルネットワークを介して、オブジェクトトークンをルームローカルなリレーショナルコンテキストで強化し、ルームレベルの抽象化のための学習されたルームトークンを導入し、シーントポロジに応じたルート情報に幾何学的バイアスを持つ階層型アテンションマスクを適用する。
CAIRNは,マルチルーム3Dシーン理解のためのHM3DのベンチマークであるCAIRN-MR上で開発された。
実験の結果、CAIRNは5つのシングルルームベンチマークで競争力を維持しながら、すべてのCAIRN-MRタスクで3D-LLMよりも大きなマージンで性能が向上した。
関連論文リスト
- Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding [39.18256367776712]
我々は,人間のインタラクションを自然に支援しながら,幅広い3Dシーン理解タスクを行う3D VLMであるNDTokenizer3Dを提案する。
このアプローチのコアは,NDT(Multi-Scale Normal Distributions Transform)表現に基づいて構築された,新しい3段階のシーントークン化パイプラインである。
NDTokenizer3Dは、まず、生高解像度の点雲からマルチスケールのNDT表現を構築し、大域的コンテキストと微粒な幾何学的詳細の両方を保存する。
論文 参考訳(メタデータ) (2025-11-26T09:12:17Z) - Multimodal 3D Reasoning Segmentation with Complex Scenes [92.92045550692765]
シーン内の複数のオブジェクトによるセグメンテーションを推論するための3次元推論セグメンテーションタスクを提案する。
このタスクは、オブジェクト間の3次元空間関係によって強化された3Dセグメンテーションマスクと詳細なテキスト説明を作成することができる。
さらに,複数のオブジェクトのクエリを扱う新しい3D推論ネットワークMORE3Dを設計する。
論文 参考訳(メタデータ) (2024-11-21T08:22:45Z) - Four Ways to Improve Verbo-visual Fusion for Dense 3D Visual Grounding [56.00186960144545]
3Dビジュアルグラウンドティング(3D visual grounding)は、自然言語で記述された3Dシーンでオブジェクトをローカライズするタスクである。
そこで本研究では,高密度な3次元グラウンドネットワークを提案し,グラウンド性能向上を目的とした4つの新しいスタンドアローンモジュールを提案する。
論文 参考訳(メタデータ) (2023-09-08T19:27:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。