論文の概要: EgoHieraLoc: A Cortically Inspired Hierarchical Segmentation-Guided Framework for Egocentric Visual Query Localization
- arxiv url: http://arxiv.org/abs/2608.09656v1
- Date: Mon, 10 Aug 2026 14:31:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.307476
- Title: EgoHieraLoc: A Cortically Inspired Hierarchical Segmentation-Guided Framework for Egocentric Visual Query Localization
- Title(参考訳): EgoHieraLoc - エゴセントリックなビジュアルクエリローカライゼーションのための階層型階層型セグメンテーションガイドフレームワーク
- Abstract要約: ビジュアルクエリローカライゼーション(VQL)は、エゴセントリックなビデオでクエリ対象を検索し、再ローカライズすることを目的としている。
人間の視覚は階層的なプロセスを通じてあいまいさを扱う。
我々は,VQL-2DとVQL-3Dの統一フレームワークである textbfEgoHieraLoc を提案する。
- 参考スコア(独自算出の注目度): 9.547789251222838
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual query localization (VQL) aims to retrieve and re-localize a queried object in egocentric videos, yet remains challenging when object boundaries are ambiguous and global context cannot effectively guide fine-grained localization. Human vision handles such ambiguity through a hierarchical process: it rapidly screens foreground candidates, selectively attends to the target despite distractors, refines perception via feedback between global context and local detail, and, when a single view is unreliable, integrates evidence across viewpoints according to its credibility. Inspired by these competencies, we propose \textbf{EgoHieraLoc}, a unified framework for VQL-2D and VQL-3D. A Discriminative Parsing Module first extracts foreground-aware query representations using segmentation priors; a Query-Aware Module then performs robust target localization through discriminative correlation filtering with deformable modeling; and a Regional Adaptation Module feeds multi-scale context back into local regions to recover precise object boundaries. To extend this perceptual hierarchy to 3D localization, we introduce Geometric-Semantic Joint Confidence (GSJC), which multiplicatively couples segmentation confidence with local depth consistency, multi-view back-projection consistency, and triangulation-baseline quality, so that a viewpoint contributes to the 3D estimate only when it is credible both semantically and geometrically. Extensive experiments demonstrate state-of-the-art performance on both VQL-2D and -3D benchmarks.
- Abstract(参考訳): ビジュアルクエリローカライゼーション(VQL)は、エゴセントリックなビデオでクエリされたオブジェクトを検索して再ローカライズすることを目的としている。
人間の視覚は階層的なプロセスを通じてそのような曖昧さを処理し、前景の候補者を素早くスクリーニングし、気を散らすことなくターゲットに選択的に出席し、グローバルな文脈と局所的な詳細の間のフィードバックを通じて知覚を洗練し、単一の視点が信頼できない場合、その信頼性に応じて視点を越えて証拠を統合する。
これらの能力に触発されて、VQL-2DとVQL-3Dの統一フレームワークである‘textbf{EgoHieraLoc}’を提案する。
識別的パーシングモジュールは、まずセグメンテーションプリエンスを使用して、フォアグラウンド対応のクエリ表現を抽出し、クエリ・アウェアモジュールは、デフォルマブルモデリングによる識別的相関フィルタリングを通じて、ロバストなターゲットローカライゼーションを実行する。
この知覚階層を3次元局所化に拡張するために,局所深度整合性,多視点バックプロジェクション整合性,三角ベースライン品質と分割信頼度を乗算的に組み合わせた幾何学的・意味的結合信頼(GSJC)を導入する。
大規模な実験では、VQL-2Dと-3Dベンチマークの両方で最先端のパフォーマンスを示している。
関連論文リスト
- From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation [40.51712647240084]
UAVビジョン言語ナビゲーション(UAV-VLN)は、空のエージェントがオープンな3D環境で自然言語の指示に従うことを可能にすることに焦点を当てている。
現在のアプローチは、視覚的な観察における命令関連ランドマークの弱い接地、長距離履歴の不十分な活用、局所的なトラップや反復的な探索による不安定な決定の3つの複合的な問題に悩まされている。
これらの問題に対処する統合的意味決定フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-10T12:59:50Z) - Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization [93.79141221821858]
OpenReLocは、シーン理解と正確なポーズ推定機能を提供するために設計されたカメラ再ローカライズシステムである。
2D-3Dオブジェクトマッチングのためのオープン語彙意味知識を統合するためのマルチモーダル機構を提案する。
実験により、OpenReLocは、様々なデータセット間で、より優れた再ローカライズリコールと精度を実現することが示された。
論文 参考訳(メタデータ) (2026-06-23T16:27:04Z) - IGV-RRT: Prior-Real-Time Observation Fusion for Active Object Search in Changing Environments [10.748685496551067]
本研究では,不確実性を認識したシーン先行状況とオンライン目標関連度推定を組み合わせた確率的計画手法を提案する。
このフレームワークは、2層セマンティックマッピングモジュールとリアルタイムプランナーを含んでいる。
提案手法は, 対象再配置の影響を効果的に軽減し, 探索効率の向上と成功率の向上を実現する。
論文 参考訳(メタデータ) (2026-03-23T12:14:26Z) - PC-CrossDiff: Point-Cluster Dual-Level Cross-Modal Differential Attention for Unified 3D Referring and Segmentation [40.5034963034718]
3Dビジュアルグラウンディングは2つのコアタスクを通して自然言語参照表現をローカライズすることを目的としている: Referring Expression (3DREC)とReferring Expression (3DRES)
既存の手法は、暗黙の局所化キューの不十分な解析と、共起物体からの動的空間干渉の非効率な抑制という、複雑な多目的シーンにおいて2つの重要な課題に直面している。
PC-CrossDiffは3DRECと3DRESのための2レベルクロスモーダルアテンションアーキテクチャを備えた統合デュアルタスクフレームワークである。
論文 参考訳(メタデータ) (2026-03-18T14:16:48Z) - Seeing the Unseen: Mask-Driven Positional Encoding and Strip-Convolution Context Modeling for Cross-View Object Geo-Localization [8.559240391514063]
クロスビューオブジェクトジオローカライゼーションは、クロスビューマッチングによる高精度オブジェクトローカライゼーションを可能にする。
既存の手法はキーポイントに基づく位置符号化に依存しており、オブジェクトの形状情報を無視しながら2次元座標のみをキャプチャする。
空間座標と物体シルエットの両方を捕捉するために分割マスクを利用するマスクベースの位置符号化方式を提案する。
EDGeoは、堅牢なクロスビューオブジェクトジオローカライズのためのエンドツーエンドフレームワークである。
論文 参考訳(メタデータ) (2025-10-23T06:07:07Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z) - Hierarchical Scoring with 3D Gaussian Splatting for Instance Image-Goal Navigation [27.040017548286812]
インスタンスイメージゴールナビゲーション(IIN)では、任意の視点から捉えた参照画像に描かれた対象物や場所を特定し、ナビゲートする必要がある。
ターゲットマッチングのための最適視点を推定する階層的スコアリングパラダイムを備えた新しいIINフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-09T00:58:14Z) - EgoSplat: Open-Vocabulary Egocentric Scene Understanding with Language Embedded 3D Gaussian Splatting [108.15136508964011]
EgoSplatは、オープン・ボキャブラリ・エゴセントリック・シーン理解のための3Dガウス・スプレイティング・フレームワークである。
EgoSplatは2つのデータセット上のローカライゼーションタスクとセグメンテーションタスクの両方において、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-03-14T12:21:26Z) - Hierarchical Temporal Context Learning for Camera-based Semantic Scene Completion [57.232688209606515]
カメラによるセマンティックシーンの補完を改善するための,新たな時間的文脈学習パラダイムであるHTCLを提案する。
提案手法は,Semantic KITTIベンチマークで1st$をランク付けし,mIoUの点でLiDARベースの手法を超えている。
論文 参考訳(メタデータ) (2024-07-02T09:11:17Z) - MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations [55.022519020409405]
本稿では,マルチモーダルな3Dシーンデータセットと階層型言語アノテーションを用いたベンチマーク,MMScanを構築した。
結果として得られたマルチモーダルな3Dデータセットは、109kオブジェクトと7.7kリージョン上の1.4Mメタアノテーション付きキャプションと、3Dビジュアルグラウンドと質問応答ベンチマークのための3.04M以上の多様なサンプルを含んでいる。
論文 参考訳(メタデータ) (2024-06-13T17:59:30Z) - LCPFormer: Towards Effective 3D Point Cloud Analysis via Local Context
Propagation in Transformers [60.51925353387151]
本稿では,近隣地域間のメッセージパッシングを活用するために,LCP (Local Context Propagation) という新しいモジュールを提案する。
隣接するローカル領域の重複点を仲介として使用した後、異なるローカルリージョンからの共有ポイントの特徴を再重み付けし、その後、次のレイヤに渡す。
提案手法は, 異なるタスクに適用可能であり, 3次元形状分類や高密度予測タスクを含むベンチマークにおいて, 様々なトランスフォーマーベースの手法より優れる。
論文 参考訳(メタデータ) (2022-10-23T15:43:01Z) - InstanceRefer: Cooperative Holistic Understanding for Visual Grounding
on Point Clouds through Instance Multi-level Contextual Referring [38.13420293700949]
InstanceReferと呼ばれる新しいモデルを提案し、ポイントクラウド上で優れた3Dビジュアルアースを実現します。
提案モデルではまず, 点雲上の単眼領域からインスタンスをフィルタリングし, 少数の候補を得る。
実験によれば、instancereferは以前のstate-of-the-artメソッドを大きく上回っている。
論文 参考訳(メタデータ) (2021-03-01T16:59:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。