論文の概要: Query Rewriting for Complex Object Segmentation in 4D Gaussian Representations
- arxiv url: http://arxiv.org/abs/2609.02664v1
- Date: Wed, 02 Sep 2026 14:40:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.41718
- Title: Query Rewriting for Complex Object Segmentation in 4D Gaussian Representations
- Title(参考訳): 4次元ガウス表現における複雑なオブジェクト分割のためのクエリ書き換え
- Authors: Thanh-Khoi Nguyen, Thien-Phuc Tran, Minh-Triet Tran,
- Abstract要約: 4次元ガウス表現における複雑なオブジェクトセグメンテーションに対するクエリ書き換えの影響について検討する。
検索強化言語モデルとキーワード誘導型クエリ再構成の最近の知見に触発されて,学習自由な再解釈戦略を提案する。
提案手法は,対象中心表現に関連する意味的アンカーを保ちながら,言語ノイズを段階的に低減する。
- 参考スコア(独自算出の注目度): 9.002400034836967
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent 4D Gaussian representation frameworks have demonstrated strong performance in language-guided dynamic scene understanding. However, these methods remain highly sensitive to verbose and narrative-style queries that contain noisy contextual information. In this paper, we investigate the impact of query rewriting for complex object segmentation in 4D Gaussian representations. Inspired by recent findings in retrieval-augmented language models and keyword-guided query reformulation, we propose a training-free reinterpretation strategy that transforms long descriptive queries into concise keyword-grounded forms. Our approach progressively reduces linguistic noise while preserving semantic anchors relevant to object-centric representations. Experiments on HyperNeRF and Neu3D demonstrate that concise rewritten queries significantly improve both temporal localization and spatial segmentation performance. In particular, our method improves average temporal accuracy from 60.92% to 92.21% and average vIoU from 20.08% to 76.94% without any additional fine-tuning. Extensive ablation studies further reveal that shorter, keyword-focused queries consistently yield stable video-feature similarity distributions and better alignment with object-centric Gaussian representations
- Abstract(参考訳): 最近の4Dガウス表現フレームワークは言語誘導動的シーン理解において強い性能を示している。
しかし、これらの手法は、雑音の多い文脈情報を含む動詞や物語スタイルのクエリに非常に敏感なままである。
本稿では,4次元ガウス表現における複雑なオブジェクト分割に対するクエリ書き換えの影響について検討する。
検索強化言語モデルとキーワード誘導型クエリ再構成の最近の知見に触発されて、長い記述型クエリを簡潔なキーワード接地形式に変換する訓練不要な再解釈戦略を提案する。
提案手法は,対象中心表現に関連する意味的アンカーを保ちながら,言語ノイズを段階的に低減する。
HyperNeRFとNeu3Dの実験により、簡潔な書き換えクエリは時間的局所化と空間的セグメンテーション性能の両方を著しく改善することが示された。
特に,平均時間精度は60.92%から92.21%に向上し,vIoUは20.08%から76.94%に改善した。
広範囲にわたるアブレーション研究により、短いキーワード中心のクエリは安定したビデオ特徴の類似度分布を常に生成し、オブジェクト中心ガウス表現との整合性が向上することが明らかとなった。
関連論文リスト
- PanopticQuery: Unified Query-Time Reasoning for 4D Scenes [53.672906752290665]
4Dシーンでクエリ時間推論を統一するフレームワークであるPanopticQueryを紹介した。
提案手法は高忠実度動的再構成のための4次元ガウススプラッティングに基づいている。
動的シーンにおける言語ベースのクエリのための新しいベンチマークであるPanoptic-L4Dを提案する。
論文 参考訳(メタデータ) (2026-04-07T09:40:05Z) - Efficient Conversational Search via Topical Locality in Dense Retrieval [9.38751103209178]
我々は、応答時間を改善するために、会話クエリに固有のトピックの局所性を利用する。
クエリの埋め込み類似性を活用することで,検索空間を意味的に関連するドキュメントクラスタに動的に制限する。
その結果,提案システムは複雑なマルチターンクエリを高い精度と効率で効果的に処理できることが示唆された。
論文 参考訳(メタデータ) (2025-04-30T10:56:34Z) - Learning Spatial-Semantic Features for Robust Video Object Segmentation [108.045326229865]
本稿では,空間意味的特徴と識別的オブジェクトクエリを学習する,ロバストなビデオオブジェクトセグメンテーションフレームワークを提案する。
DAVIS 2017 test (textbf87.8%)、YoutubeVOS 2019 (textbf88.1%)、MOSE val (textbf74.0%)、LVOS test (textbf73.0%)を含むベンチマークデータセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-07-10T15:36:00Z) - Efficient Inverted Indexes for Approximate Retrieval over Learned Sparse Representations [8.796275989527054]
本稿では,学習したスパース埋め込みを高速に検索できる逆インデックスの新たな組織を提案する。
提案手法では,逆リストを幾何学的に結合したブロックに整理し,それぞれに要約ベクトルを備える。
以上の結果から, 地震動は, 最先端の逆インデックスベースソリューションよりも1~2桁高速であることが示唆された。
論文 参考訳(メタデータ) (2024-04-29T15:49:27Z) - Dense X Retrieval: What Retrieval Granularity Should We Use? [56.90827473115201]
しばしば見過ごされる設計選択は、コーパスが索引付けされる検索単位である。
本稿では,高密度検索のための新しい検索ユニット,命題を提案する。
実験により、提案のような細粒度単位によるコーパスのインデックス付けは、検索タスクにおける通過レベル単位を著しく上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2023-12-11T18:57:35Z) - Making Retrieval-Augmented Language Models Robust to Irrelevant Context [55.564789967211844]
ALMの重要なデシプラタムは、検索された情報が関連する場合のパフォーマンスをモデル化するのに役立つことである。
近年の研究では、検索の増大がパフォーマンスに悪影響を及ぼすことが示されている。
論文 参考訳(メタデータ) (2023-10-02T18:52:35Z) - Semantics-Aware Dynamic Localization and Refinement for Referring Image
Segmentation [102.25240608024063]
画像の参照は、言語表現からのイメージセグメントを参照する。
そこで我々は,局所化中心からセグメンテーション言語へ移行するアルゴリズムを開発した。
比較すると,本手法はより汎用的で有効である。
論文 参考訳(メタデータ) (2023-03-11T08:42:40Z) - RETRONLU: Retrieval Augmented Task-Oriented Semantic Parsing [11.157958012672202]
マルチドメインタスク指向のセマンティックパーシングの問題に対して,検索に基づくモデリングのアイデアを適用している。
我々のアプローチであるRetroNLUは、シーケンス・ツー・シーケンス・モデルアーキテクチャを検索コンポーネントで拡張する。
近隣の検索コンポーネントの品質、モデルの感度を分析し、発話の複雑さの異なる意味解析の性能を分解する。
論文 参考訳(メタデータ) (2021-09-21T19:30:30Z) - Probing Linguistic Features of Sentence-Level Representations in Neural
Relation Extraction [80.38130122127882]
ニューラルリレーション抽出(RE)に関連する言語特性を対象とした14の探索タスクを導入する。
私たちは、40以上の異なるエンコーダアーキテクチャと2つのデータセットでトレーニングされた言語的特徴の組み合わせによって学習された表現を研究するためにそれらを使用します。
アーキテクチャによって引き起こされるバイアスと言語的特徴の含意は、探索タスクのパフォーマンスにおいて明らかに表現されている。
論文 参考訳(メタデータ) (2020-04-17T09:17:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。