論文の概要: EviSplat: Preserving Multi-View Evidence in 3D Gaussian Splatting for Open-Vocabulary Segmentation
- arxiv url: http://arxiv.org/abs/2609.34853v1
- Date: Mon, 28 Sep 2026 10:46:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 02:12:54.900229
- Title: EviSplat: Preserving Multi-View Evidence in 3D Gaussian Splatting for Open-Vocabulary Segmentation
- Title(参考訳): EviSplat:オープンボキャブラリセグメンテーションのための3次元ガウススプラッティングにおける多視点エビデンス保存
- Abstract要約: EviSplatは、個々の観察特徴を後続のテキストクエリの証拠として保存する。
EviSplatは最も関連する観測値を使用して各インスタンスをスコアする。
次に、各ガウスに関するスコアを、局所的に支持された証拠とインスタンスレベルの関連性を組み合わせることで計算する。
- 参考スコア(独自算出の注目度): 25.789571857159743
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-vocabulary 3D scene understanding enables object localization and segmentation from free-form text queries without a fixed category vocabulary. Many recent methods build on 3D Gaussian Splatting and consolidate multi-view observations, such as masked crops from individual views, into language features or compact object descriptors before the query is known. However, observations of the same object vary across viewpoints and are not equally informative: some reveal cues relevant to a particular query, whereas others provide incomplete or misleading evidence. Pre-query consolidation can therefore suppress cues on which a later query depends. We introduce EviSplat, which preserves individual observation features as evidence for later text queries. EviSplat retains individual observation features within class-agnostic 3D instances that represent objects, object parts, or background regions. It also learns, for each Gaussian, a distribution describing which visual appearances its observations support. Given a text query, EviSplat scores each instance using its most relevant observations. It then computes a score for each Gaussian by combining instance-level relevance with locally supported evidence, weighted by how often and how unambiguously that Gaussian was observed. Different queries can thus draw on different visual cues from the same preserved evidence. Experiments across diverse datasets and evaluation protocols demonstrate state-of-the-art performance, supporting the benefit of preserving multi-view evidence until query time and aggregating it according to the query.
- Abstract(参考訳): Open-vocabulary 3D scene understandingは、固定されたカテゴリ語彙なしで自由形式のテキストクエリからオブジェクトのローカライズとセグメンテーションを可能にする。
近年の多くの手法は3次元ガウススプラッティングに基づいて構築され、個々のビューからのマスキング作物のような多視点観察を、クエリが知られる前に言語特徴やコンパクトなオブジェクト記述子に集約する。
しかし、同じ対象の観察は視点によって異なり、等しく有益ではない:ある特定のクエリに関連する手がかりを明らかにするものもあれば、不完全または誤解を招く証拠を提供するものもある。
事前クエリの統合は、後続のクエリが依存するキューを抑制することができる。
EviSplatは、個々の観察特徴を後続のテキストクエリの証拠として保存する。
EviSplatは、オブジェクト、オブジェクト部分、バックグラウンド領域を表すクラスに依存しない3Dインスタンス内で、個々の観察機能を保持する。
また、各ガウスについて、その観察を支援する視覚的な外観を記述する分布を学習する。
テキストクエリを与えられたEviSplatは、最も関連性の高い観測値を使用して各インスタンスをスコアする。
そして、各ガウスのインスタンスレベルの関連性と局所的に支持された証拠を組み合わせることで、ガウスの頻度と、ガウスが観測されたことの曖昧さを重み付けして、各ガウスのスコアを計算する。
したがって、異なるクエリは、同じ保存された証拠から異なる視覚的手がかりを引き出すことができる。
さまざまなデータセットと評価プロトコルにわたる実験は、クエリ時間までマルチビューエビデンスを保存し、クエリに従ってアグリゲーションするというメリットをサポートする、最先端のパフォーマンスを示す。
関連論文リスト
- SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding [15.452474276231799]
SeqAlign3DVGは、時間順に順序付けされ、厳密な3D画像ベースの視覚的グラウンドティングに特化した新しいベンチマークである。
9,622のシングルビューと14,493のシーケンスサンプルで構成されており、豊富な記述、複雑な関係、複数インスタンスの曖昧さが特徴である。
提案手法は,Deep-freeプロトコルの下での最先端性能を実現し,複雑な関係や外観の手がかりによって定義されるターゲットの局所化を大幅に改善する。
論文 参考訳(メタデータ) (2026-08-31T08:38:29Z) - UniqueSplat: View-conditioned 3D Gaussian Splatting for Generalizable 3D Reconstruction [66.8743195106848]
本稿では,ビュークエリ毎にカスタマイズされた3次元ラディアンスフィールドを再構成するために,ビュー条件付きフィードフォワード3Dガウススプラッティングモデルを提案する。
我々のUniqueSplatは、ビュー条件付き情報を事前学習し、この知識をネットワークパラメータに組み込む。
広く使われているデータセットの実験は、最先端の手法よりもUniqueSplatの方が優れていることを示している。
論文 参考訳(メタデータ) (2026-08-03T12:31:12Z) - OpenGaFF: Open-Vocabulary Gaussian Feature Field with Codebook Attention [80.51557267896938]
オープンな3Dシーン理解のための新しいフレームワークであるOpenGaFFについて述べる。
我々の手法の中核はガウス的特徴場であり、ガウス幾何学と外見の連続関数として意味論をモデル化する。
オブジェクトレベルのセマンティック一貫性をさらに強化するために、共有セマンティックプリミティブのセットとして機能する構造化コードブックを導入する。
論文 参考訳(メタデータ) (2026-05-07T12:10:07Z) - Memory-Augmented Vision-Language Agents for Persistent and Semantically Consistent Object Captioning [27.48318501076437]
VLM(Vision-Language Models)はしばしば、視点を越えて同じオブジェクトの一貫性のない記述をもたらす。
本稿では,データアソシエーション,オブジェクトキャプション,探索ポリシを同時に処理するメモリ拡張型ビジョンランゲージエージェントを提案する。
標準キャプションスコアでは+11.86%、ベースラインモデルでは+7.39%の改善が見られた。
論文 参考訳(メタデータ) (2026-03-25T12:52:32Z) - Learning Spatial-Semantic Features for Robust Video Object Segmentation [108.045326229865]
本稿では,空間意味的特徴と識別的オブジェクトクエリを学習する,ロバストなビデオオブジェクトセグメンテーションフレームワークを提案する。
DAVIS 2017 test (textbf87.8%)、YoutubeVOS 2019 (textbf88.1%)、MOSE val (textbf74.0%)、LVOS test (textbf73.0%)を含むベンチマークデータセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-07-10T15:36:00Z) - CountGD: Multi-Modal Open-World Counting [54.88804890463491]
本稿では,画像中のオープン語彙オブジェクトの数値化の一般化と精度の向上を目的とする。
本稿では,最初のオープンワールドカウントモデルであるCountGDを紹介した。
論文 参考訳(メタデータ) (2024-07-05T16:20:48Z) - Unsupervised Opinion Summarization Using Approximate Geodesics [38.19696482602788]
我々は,未指導の抽出的意見要約を行う新しいシステムであるGeoSumm(GeoSumm)を紹介する。
GeoSummはエンコーダ-デコーダに基づく表現学習モデルで、潜在意味単位上の分布としてテキストの表現を生成する。
我々はこれらの表現を用いて、新しい測地線距離に基づくスコアリング機構を用いて、レビュー文の妥当性を定量化する。
論文 参考訳(メタデータ) (2022-09-15T17:37:08Z) - Weakly-Supervised Aspect-Based Sentiment Analysis via Joint
Aspect-Sentiment Topic Embedding [71.2260967797055]
アスペクトベース感情分析のための弱教師付きアプローチを提案する。
We learn sentiment, aspects> joint topic embeddeds in the word embedding space。
次に、ニューラルネットワークを用いて単語レベルの識別情報を一般化する。
論文 参考訳(メタデータ) (2020-10-13T21:33:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。