論文の概要: Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models
- arxiv url: http://arxiv.org/abs/2605.09218v1
- Date: Sat, 09 May 2026 23:35:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.119871
- Title: Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models
- Title(参考訳): Flame3D: エージェント言語モデルを用いた3次元シーンのゼロショット合成推論
- Abstract要約: 3Dシーンの理解は、自由空間、オブジェクトの接地、仮説的なオブジェクト挿入、複雑な幾何学的関係、これら全てを外部ツールやデータソースと統合する。
3次元言語学習を動機づける広義の一般化は,3次元特化学習を伴わずに,推論時に達成できると論じる。
本研究では,シーンを編集可能な3Dメモリとして表現する学習自由フレームワークFlame3Dを提案する。
- 参考スコア(独自算出の注目度): 6.943087230186317
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: 3D scene understanding spans reasoning about free space, object grounding, hypothetical object insertions, complex geometric relationships, and integrating all of these with external tools and data sources. Existing 3D understanding methods typically rely on large-scale 3D-language training or focus on object grounding and simple spatial relationships. We argue that the broad generalization that motivates 3D-language training can be achieved at inference time, without 3D-specific training. We propose Flame3D, a training-free framework that represents scenes as editable visual-textual 3D memories and exposes them to an off-the-shelf MLLM through composable spatial tools. Flame3D also lets the agent synthesize custom spatial programs at inference time, enabling open-ended reasoning over layouts, empty space, and objects not yet present in the scene. External data and corrections can be added to the memory without retraining. In addition to showing competitive performance to finetuned 3D-LMM methods on ScanQA, we study multi-hop 3D reasoning capabilities of Flame3D by evaluating it on a curated compositional spatial-reasoning benchmark, Compose3D. We find that fixed tools fall short and that the agent's ability to synthesize spatial operations at inference time is essential. These results invite the question: should future progress in 3D scene understanding focus on richer scene memories and expressive compositional abstractions?
- Abstract(参考訳): 3Dシーンの理解は、自由空間、オブジェクトの接地、仮説的なオブジェクト挿入、複雑な幾何学的関係、これら全てを外部ツールやデータソースと統合する。
既存の3D理解手法は、通常、大規模な3D言語訓練や、オブジェクトの接地や単純な空間的関係に重点を置いている。
3次元言語学習を動機づける広義の一般化は,3次元特化学習を伴わずに,推論時に達成できると論じる。
本研究では,シーンを編集可能な3Dメモリとして表現し,構成可能な空間ツールを通じて既製のMLLMに公開する,学習不要のフレームワークFlame3Dを提案する。
Flame3Dはまた、エージェントが推論時にカスタム空間プログラムを合成し、レイアウト、空きスペース、シーンにまだ存在しないオブジェクトに対するオープンな推論を可能にする。
外部データと修正は、再トレーニングすることなくメモリに追加することができる。
ScanQA上での微調整3D-LMM手法の競争性能を示すことに加え、Flame3Dのマルチホップ3D推論能力について、合成空間推論ベンチマークCompose3Dで評価した。
固定ツールが不足し,エージェントが推論時に空間操作を合成できることが不可欠であることがわかった。
今後の3Dシーン理解の進歩は、よりリッチなシーン記憶と表現豊かな構成抽象化に焦点を合わせるべきか?
関連論文リスト
- Do 3D Large Language Models Really Understand 3D Spatial Relationships? [80.64317885117704]
3次元大言語モデルは3次元世界、特に物体間の空間的関係を理解していると主張している。
テキストのみの質問応答ペア上での言語モデルの微調整は、3D入力を使わずにSQA3Dベンチマークでこれらの手法を相容・超越することができる。
本稿では,より厳密な評価ベンチマークであるReal-3DQAを紹介する。
論文 参考訳(メタデータ) (2026-03-06T16:04:34Z) - ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models [0.0]
ZING-3Dは、ゼロショット方式で3Dシーンのリッチな意味表現を生成するフレームワークである。
また、3D空間におけるインクリメンタルな更新と幾何学的接地を可能にし、下流のロボティクスアプリケーションに適している。
Replica と HM3D データセットを用いた実験により,ZING-3D はタスク固有の訓練を必要とせず,空間的および関係的な知識を捉えるのに有効であることが示された。
論文 参考訳(メタデータ) (2025-10-24T00:52:33Z) - SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes [105.8644620467576]
Stextscurprise3Dは複雑な3次元シーンにおける言語誘導空間推論のセグメンテーションを評価するために設計された新しいデータセットである。
Stextscurprise3Dは、ScanNet++ v2から900以上の詳細な屋内シーンにわたる200k以上の視覚言語ペアで構成されている。
データセットには、オブジェクト名なしで意図的に作成される89k以上の人間アノテーション付き空間クエリが含まれている。
論文 参考訳(メタデータ) (2025-07-10T14:01:24Z) - Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs [72.11701578308804]
本稿では,最近の3次元視覚言語モデルを3次元オブジェクト中心,2次元イメージベース,および3次元シーン中心のアプローチに分類する。
3Dシーン中心のVLMと2Dシーン中心のVLMのアーキテクチャ的類似性にもかかわらず、最新の3Dオブジェクト中心と2Dイメージベースアプローチと比較して比較的低い性能を示した。
本研究は,これらのモデルが多モードアライメント機能を有する一方で,言語的手がかりに過度に頼り,頻繁な回答に過度に適合する傾向があることを示唆している。
論文 参考訳(メタデータ) (2025-06-05T17:56:12Z) - SceneGPT: A Language Model for 3D Scene Understanding [0.9054540533394926]
SceneGPTは,3次元の空間的推論をトレーニングや明示的な3次元の監督なしに行うことができるLLMベースのシーン理解システムである。
本フレームワークの主な構成要素は,1)シーン表現として機能し,シーン内のオブジェクトとその空間関係を符号化する3次元シーングラフ,2)3次元空間推論のための文脈学習に適応可能な事前学習LLMである。
論文 参考訳(メタデータ) (2024-08-13T14:26:30Z) - Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models [20.277479473218513]
オブジェクトの検索とローカライズのためのZero-Shot 3D Reasoningを提案する。
複雑なコマンドを理解し実行するためのシンプルなベースラインメソッドReasoning3Dを設計する。
Reasoning3Dは、暗黙のテキストクエリに基づいて、3Dオブジェクトの一部を効果的にローカライズし、ハイライトすることができることを示す。
論文 参考訳(メタデータ) (2024-05-29T17:56:07Z) - Agent3D-Zero: An Agent for Zero-shot 3D Understanding [79.88440434836673]
Agent3D-Zeroは、3Dシーン理解に対処する革新的な3D対応エージェントフレームワークである。
本稿では,3次元理解のための視点を積極的に選択し,分析することで,VLM(Large Visual Language Model)を利用する新しい手法を提案する。
Agent3D-Zeroの独特な利点は、新しい視覚的プロンプトの導入である。
論文 参考訳(メタデータ) (2024-03-18T14:47:03Z) - Four Ways to Improve Verbo-visual Fusion for Dense 3D Visual Grounding [56.00186960144545]
3Dビジュアルグラウンドティング(3D visual grounding)は、自然言語で記述された3Dシーンでオブジェクトをローカライズするタスクである。
そこで本研究では,高密度な3次元グラウンドネットワークを提案し,グラウンド性能向上を目的とした4つの新しいスタンドアローンモジュールを提案する。
論文 参考訳(メタデータ) (2023-09-08T19:27:01Z) - Chat-3D: Data-efficiently Tuning Large Language Model for Universal
Dialogue of 3D Scenes [56.727745047799246]
3Dシーンの理解は幅広い用途で注目されている。
本稿では,事前学習した3次元表現の3次元視覚的知覚能力と,高度なLCMの印象的な推論と会話能力を組み合わせたChat-3Dを提案する。
論文 参考訳(メタデータ) (2023-08-17T03:52:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。