論文の概要: SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding
- arxiv url: http://arxiv.org/abs/2608.30451v1
- Date: Mon, 31 Aug 2026 08:38:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.319383
- Title: SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding
- Title(参考訳): SeqAlign3DVG:3次元視覚グラウンドのための逐次調整型ベンチマークとボクセル推論フレームワーク
- Abstract要約: SeqAlign3DVGは、時間順に順序付けされ、厳密な3D画像ベースの視覚的グラウンドティングに特化した新しいベンチマークである。
9,622のシングルビューと14,493のシーケンスサンプルで構成されており、豊富な記述、複雑な関係、複数インスタンスの曖昧さが特徴である。
提案手法は,Deep-freeプロトコルの下での最先端性能を実現し,複雑な関係や外観の手がかりによって定義されるターゲットの局所化を大幅に改善する。
- 参考スコア(独自算出の注目度): 15.452474276231799
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Image-based 3D visual grounding is critical for embodied agents, yet existing benchmarks suffer from loose text-observation alignment and neglect temporal ordering. We introduce SeqAlign3DVG, a novel benchmark dedicated to temporally ordered and strictly observation-aligned image-based 3D visual grounding. Unlike prior works using order-agnostic views or global point clouds, SeqAlign3DVG ensures all expressions are human-verified and strictly grounded in the provided RGB observations (single frames or ordered observation sequences). It comprises 9,622 single-view and 14,493 sequence samples featuring rich descriptions, complex relations, and multi-instance ambiguities. To tackle this benchmark, we propose a unified voxel-based pipeline featuring Relevance-Ordered Voxel Memory (ROVM) and Progressive Language-Voxel Fusion (PLVF). ROVM dynamically ranks and aggregates multi-view evidence via a conservative memory to mitigate noisy observations, while PLVF performs coarse-to-fine spatial-linguistic reasoning for precise disambiguation. Our approach achieves state-of-the-art performance under the depth-free protocol, significantly improving localization for targets defined by complex relations and appearance cues.
- Abstract(参考訳): 画像ベースの3Dビジュアルグラウンドティングは、エンボディエージェントにとって重要であるが、既存のベンチマークは、緩やかなテキスト・オブザーブレーションアライメントと時間的順序の無視に悩まされている。
SeqAlign3DVGは、時間的に順序付けされ、厳密に観察された画像に基づく3次元視覚的グラウンドティングに特化した新しいベンチマークである。
順序に依存しないビューやグローバルなポイントクラウドを使った以前の作業とは異なり、SeqAlign3DVGは、すべての表現が人間によって検証され、提供されたRGB観測(単一のフレームまたは順序付き観測シーケンス)に厳格に基づいていることを保証している。
9,622のシングルビューと14,493のシーケンスサンプルで構成されており、豊富な記述、複雑な関係、複数インスタンスの曖昧さが特徴である。
このベンチマークに対処するため、Relevance-Ordered Voxel Memory (ROVM) とProgressive Language-Voxel Fusion (PLVF) を組み合わせた統一ボクセルベースパイプラインを提案する。
ROVMは、ノイズを和らげるために、保守的な記憶を通して複数のビューエビデンスを動的にランク付けし集約する一方、PLVFは、正確な曖昧さのために粗い空間言語推論を行う。
提案手法は,Deep-freeプロトコルの下での最先端性能を実現し,複雑な関係や外観の手がかりによって定義されたターゲットの局所化を大幅に改善する。
関連論文リスト
- From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation [40.51712647240084]
UAVビジョン言語ナビゲーション(UAV-VLN)は、空のエージェントがオープンな3D環境で自然言語の指示に従うことを可能にすることに焦点を当てている。
現在のアプローチは、視覚的な観察における命令関連ランドマークの弱い接地、長距離履歴の不十分な活用、局所的なトラップや反復的な探索による不安定な決定の3つの複合的な問題に悩まされている。
これらの問題に対処する統合的意味決定フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-10T12:59:50Z) - TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting [10.787720313658093]
本稿では,3次元ガウススプラッティング(3DGS)におけるオープンワールド参照セグメンテーションを実現する完全自動パイプラインであるTrackRef3Dを提案する。
本稿では,同義語クラスタリングとトラジェクティブ・アウェア投票を通じて,クロスビュー予測を集約し,標準的セマンティック・アイデンティティを確立するトラジェクティブ・アウェア・セマンティック・コンセンサス・モジュール(TSCM)を提案する。
論文 参考訳(メタデータ) (2026-05-26T05:49:12Z) - SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching [2.4737219202679808]
SceneGrapherは,再構成された3次元シーングラフ上の構造化グラフマッチングとして3次元グラウンドを再構成するフレームワークである。
我々は,移動ロボットによる実世界展開によるフレームワークの実証を行い,長距離物理環境における堅牢な空間推論を実証した。
論文 参考訳(メタデータ) (2026-05-20T22:30:51Z) - VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models [55.12929235609365]
現在の視覚言語アクション(VLA)モデルの視覚バックボーンは、主に3次元幾何学的監督を伴わない2次元画像データに事前訓練されている。
既存の暗黙の接地法は、VLA特徴を3D認識基盤モデルと整合させることによって、この問題に部分的に対処する。
DINOv2-FiT3D の空間認識機能と VLA の視覚エンコーダの出力を直接一致させるフレームワーク VEGA を提案する。
論文 参考訳(メタデータ) (2026-05-11T12:44:26Z) - OVI-MAP:Open-Vocabulary Instance-Semantic Mapping [108.66131262110095]
OVI-MAPは、RGB-D入力から漸進的に構築される、クラスに依存しない3Dインスタンスマップである。
意味的特徴は、視覚言語モデルを用いて、選択された少数のビューからのみ抽出される。
我々のシステムはリアルタイムに動作し、標準ベンチマークで最先端のオープン語彙マッピングのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-03-27T15:50:59Z) - dinov3.seg: Open-Vocabulary Semantic Segmentation with DINOv3 [36.6036728217708]
Open-Vocabulary Semantics (OVSS)は、テキスト定義カテゴリのオープンセットからピクセルレベルのラベルを割り当て、推論時に見えないクラスに信頼性の高い一般化を要求する。
我々は dinov3.seg を導入し、 dinov3.txt を OVSS 専用のフレームワークに拡張した。
まず、このバックボーンに合わせたタスク固有のアーキテクチャを設計し、従来のオープン語彙セグメンテーション作業から確立した設計原則を体系的に適用する。
第2に、VTベースのエンコーダのグローバルトークンとローカルパッチレベルのビジュアル特徴の両方に整合したテキスト埋め込みを共同で活用する。
論文 参考訳(メタデータ) (2026-03-19T23:57:28Z) - RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning [61.84363374647606]
リモートセンシングビジュアルグラウンドディング(RSVG)は、自然言語記述に基づく大規模空中画像における対象物体のローカライズを目的としている。
これらの記述はしばしば位置的手がかりに大きく依存しており、空間的推論においてMLLM(Multimodal Large Language Models)に固有の課題を提起している。
空間理解の高度化を図るために,textbfRSGround-R1 と呼ばれる推論誘導型位置認識後学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T12:35:57Z) - ST-Booster: An Iterative SpatioTemporal Perception Booster for Vision-and-Language Navigation in Continuous Environments [1.9566515100805284]
VLN-CEは、自然言語命令に基づいて連続空間をナビゲートするエージェントを必要とする。
本稿では,マルチグラニュラリティ認識と命令認識推論による性能向上を目的としたナビゲーションブースターST-Boosterを紹介する。
大規模な実験と性能解析を行い、ST-Boosterが既存の最先端手法より優れていることを示した。
論文 参考訳(メタデータ) (2025-04-14T03:29:08Z) - Incremental 3D Semantic Scene Graph Prediction from RGB Sequences [86.77318031029404]
RGB画像列が与えられたシーンの一貫性のある3Dセマンティックシーングラフをインクリメンタルに構築するリアルタイムフレームワークを提案する。
提案手法は,新たなインクリメンタルエンティティ推定パイプラインとシーングラフ予測ネットワークから構成される。
提案するネットワークは,シーンエンティティから抽出した多視点および幾何学的特徴を用いて,反復的メッセージパッシングを用いた3次元セマンティックシーングラフを推定する。
論文 参考訳(メタデータ) (2023-05-04T11:32:16Z) - Occupancy Planes for Single-view RGB-D Human Reconstruction [120.5818162569105]
暗黙的な機能を持つシングルビューRGB-Dヒト再構成は、しばしばポイント単位の分類として定式化される。
本稿では,カメラの視野フラストラムをスライスする平面上での占有率予測として,一視点のRGB-D人間の再構成を定式化できる占有面(OPlanes)表現を提案する。
論文 参考訳(メタデータ) (2022-08-04T17:59:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。