論文の概要: USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning
- arxiv url: http://arxiv.org/abs/2606.25880v1
- Date: Wed, 24 Jun 2026 14:25:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.358788
- Title: USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning
- Title(参考訳): USS:潜時ダイナミクス学習による身体的視覚追跡のための一貫した空間意味プロンプト
- Abstract要約: Embodied Visual Tracking (EVT)では、エージェントが動的環境を積極的に移動しながら、指定されたターゲットを継続的に追跡する必要がある。
本稿では,EVTにおける目標指示をテキストのみの仕様から統一的な空間意味的プロンプトへと緩和するパラダイムシフトを提案する。
潜時ダイナミクス学習を用いた身体的視覚追跡のための統一空間意味プロンプトを提案する。
- 参考スコア(独自算出の注目度): 18.003030497082623
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied Visual Tracking (EVT) requires an agent to continuously follow a specified target while actively moving through dynamic environments. However, prevailing EVT paradigms predominantly rely on language-based target indication. While language is expressive and convenient, cluttered scenes often contain multiple objects that satisfy the same semantic description, leading to ambiguous target grounding. We therefore propose a paradigm shift, reframing target indication in EVT from text-only specification to unified spatial-semantic prompting. Based on this paradigm, we introduce Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning, USS, an end-to-end embodied tracking framework that supports text, point, bounding box, and mask prompts within a unified architecture. USS encodes heterogeneous prompts with modality-specific encoders, fuses prompt tokens with visual features through hybrid attention, and decodes compact prompt-conditioned representations into egocentric waypoints. To further improve temporal robustness, USS incorporates a latent world model that predicts future representations through self-supervised alignment. Real-robot experiments demonstrate that explicit spatial target cues yield higher success rates than text-only prompts, particularly in scenarios involving similar distractors and longer-horizon tracking where maintaining instance-level target identity is critical. In the simulation benchmark, USS also achieves state-of-the-art performance among non-MLLM-based methods and competitive results against recent MLLM-based approaches with faster inference speed. Our findings reveal that spatial-semantic prompting provides a more precise and flexible target indication interface for embodied visual tracking. Project site: https://arescheah.github.io/uss-project-page/.
- Abstract(参考訳): Embodied Visual Tracking (EVT)では、エージェントが動的環境を積極的に移動しながら、指定されたターゲットを継続的に追跡する必要がある。
しかし、一般的なEVTパラダイムは主に言語に基づく目標指示に依存している。
言語は表現力があり便利であるが、散らかったシーンは、しばしば同じ意味的記述を満たす複数のオブジェクトを含む。
そこで本研究では,EVTにおける目標指示を,テキストのみの仕様から統一的な空間意味的プロンプトへと緩和するパラダイムシフトを提案する。
このパラダイムに基づいて、テキスト、ポイント、バウンディングボックス、マスクプロンプトを統一アーキテクチャ内でサポートするエンドツーエンドの追跡フレームワークであるUSS、Latent Dynamics Learningによる身体的視覚追跡のためのUnified Spatial-Semantic Promptsを紹介する。
USSは、モダリティ固有のエンコーダで異種プロンプトをエンコードし、ハイブリッドアテンションを通じてプロンプトトークンを視覚的特徴で融合し、コンパクトなプロンプト条件表現をエゴセントリックなウェイポイントにデコードする。
さらに時間的ロバスト性を改善するため、USSは、自己監督的なアライメントを通じて将来の表現を予測する潜在世界モデルを導入している。
実ロボット実験は、テキストのみのプロンプトよりも明示的な空間的ターゲットキューの方が成功率が高いことを示した。
シミュレーションベンチマークでは、非MLLMベースの手法の最先端性能と、推論速度の速い最近のMLLMベースのアプローチに対する競合結果も達成している。
以上の結果から,空間意味的プロンプトにより,より正確で柔軟な目標指示インタフェースが実現できることが判明した。
プロジェクトサイト:https://arescheah.github.io/uss-project-page/。
関連論文リスト
- One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting [51.09550363815034]
シーンテキストスポッティングはテキスト認識と空間的局所化の間に高精度なアライメントを必要とする。
本研究では,個々のテキストインスタンスを単一のアンカー視覚トークンでルーティングする視覚中心のフレームワークであるSingle-Patch Text Spotting (SPaTS)を提案する。
SPaTS はフロンティアのクローズドソースMLLM と OCR MLLM の両方で一貫した性能を示し,その性能を著しく向上させる。
論文 参考訳(メタデータ) (2026-07-30T09:17:48Z) - ReferTrack: Referring Then Tracking for Embodied Visual Tracking [13.368122578638847]
Embodied visual tracking (EVT) は、自然言語で記述された特定のターゲットを連続的に追従する移動体エージェントを必要とする。
ReferTrackは、1台の前方カメラでEVTをグラウンド化する参照then追跡パラダイムである。
このモデルでは、まずインデックス付き境界ボックスからターゲットを選択し、次に、この画像グラウンド決定で条件付けられた追跡経路をデコードする。
論文 参考訳(メタデータ) (2026-07-22T12:05:13Z) - Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking [61.91472604294714]
トラッキング主成分を抽出する新しい言語依存解析機構を提案する。
我々は、事前学習された視覚言語モデルQwen-VLの強力なクロスモーダル理解能力を利用する。
本手法は,複数の大規模視覚言語追跡ベンチマークにおいて,一貫した,より優れたトラッキング性能を実現する。
論文 参考訳(メタデータ) (2026-06-28T12:12:18Z) - OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following [59.53720386342017]
拡張性のある多対人視線推論に基礎的な視覚言語モデルを適用する統合視覚言語フレームワークを提案する。
すべての個人をモデル化することにより、OmniGFは正確な空間的視線目標推定、意味的視線予測、複雑な社会的視線推定をシームレスに統合する。
論文 参考訳(メタデータ) (2026-05-26T00:08:06Z) - See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding [41.70825455674463]
SWIM(See What I Mean)は、視覚と言語表現を調整し、テキストのプロンプトからのみ、きめ細かいオブジェクト理解を可能にする訓練戦略である。
SWIMはテキスト・ビジュアル・アライメントを大幅に改善し,細粒度オブジェクト理解ベンチマークにおける視覚プロンプトに基づく手法よりも優れた性能を実現する。
論文 参考訳(メタデータ) (2026-05-18T08:09:37Z) - Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining [59.2578488860426]
不均一なマルチモーダルリモートセンシングオブジェクト検出は、多様なセンサからオブジェクトを正確に検出することを目的としている。
既存のアプローチでは、下流の微調整中にモーダリティアライメントとタスク固有の最適化が絡み合う遅延アライメントパラダイムが採用されている。
本稿では,下流のタスク学習からモダリティアライメントを明確に分離する,統一型言語パイロット事前学習フレームワークであるBabelRSを提案する。
論文 参考訳(メタデータ) (2026-03-02T11:38:12Z) - SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models [73.19044613922911]
大規模視覚言語モデル(VLM)は、転送ベースの対向摂動に対して脆弱である。
SGHA-Attackは、複数のターゲット参照を採用し、中間層一貫性を強制するフレームワークである。
オープンソースおよび商用のブラックボックスVLMの実験は、SGHA-Attackが従来の方法よりも強力な目標転送性を実現することを示している。
論文 参考訳(メタデータ) (2026-02-02T03:10:41Z) - VPTracker: Global Vision-Language Tracking via Visual Prompt and MLLM [45.56517073754981]
Vision-Language Trackingは、ビジュアルテンプレートと言語記述によって記述されたオブジェクトを継続的にローカライズすることを目的としている。
しかし、既存の手法は通常、局所的な探索に限られており、視点の変化の下で失敗する傾向がある。
我々は,多モーダル大言語モデル(VPTracker)に基づく最初のグローバルな追跡フレームワークを導入する。
論文 参考訳(メタデータ) (2025-12-28T06:12:28Z) - EPIPTrack: Rethinking Prompt Modeling with Explicit and Implicit Prompts for Multi-Object Tracking [10.065921746316642]
EPIPTrackという統合された視覚言語追跡フレームワークを提案する。
EPIPTrackは、動的ターゲットモデリングとセマンティックアライメントのための明示的および暗黙的なプロンプトを利用する。
MOT17、MOT20、Danceの実験は、EPIPTrackが様々なシナリオで既存のトラッカーより優れていることを示した。
論文 参考訳(メタデータ) (2025-10-15T07:39:30Z) - A Multimodal Depth-Aware Method For Embodied Reference Understanding [56.30142869506262]
Embodied Reference Understandingでは、言語命令とポインティングキューの両方に基づいて、視覚的なシーンで対象のオブジェクトを識別する必要がある。
本稿では,データ拡張,深度マップのモダリティ,深度認識決定モジュールを共同で活用する新しいERUフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-09T14:32:21Z) - ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking [0.6143225301480709]
視覚言語追跡は、初期フレームに提供されるテンプレートパッチと言語記述を用いて、ビデオシーケンス内の対象物を特定することを目的としている。
ロバストなトラッキングを実現するためには、ターゲットの特徴を特徴付けるだけでなく、ターゲットに関連するコンテキストの特徴を活用することが不可欠である。
動的ターゲット状態に適応したマルチモーダルキューが得られるATCTrackという新しいトラッカーを提案する。
論文 参考訳(メタデータ) (2025-07-26T09:05:12Z) - Hierarchical Instruction-aware Embodied Visual Tracking [35.73851196966425]
User-Centric Embodied Visual Tracking (UC-EVT)は、強化学習に基づくモデルにおいて、新しい課題を提示している。
我々は,テキスト空間目標を仲介として利用する命令理解と行動生成を橋渡しする,テキストbfインストラクションを意識した身体的視覚追跡(HIEVT)エージェントを提案する。
論文 参考訳(メタデータ) (2025-05-27T04:36:26Z) - Towards Unified Token Learning for Vision-Language Tracking [65.96561538356315]
本稿では,VL追跡をトークン生成タスクとして用いた「textbfMMTrack」という,視覚言語(VL)追跡パイプラインを提案する。
提案フレームワークは,言語記述と境界ボックスを離散トークン列にシリアライズする。
この新しい設計パラダイムでは、全てのトークンクエリが望ましいターゲットを認識し、ターゲットの空間座標を直接予測するために必要となる。
論文 参考訳(メタデータ) (2023-08-27T13:17:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。