論文の概要: Continuous Token-Level Spatio-Temporal Context Modeling for Visual Object Tracking
- arxiv url: http://arxiv.org/abs/2609.07070v1
- Date: Mon, 07 Sep 2026 05:57:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 01:45:42.656043
- Title: Continuous Token-Level Spatio-Temporal Context Modeling for Visual Object Tracking
- Title(参考訳): 視覚的物体追跡のための連続トークンレベル時空間モデル
- Abstract要約: 本稿では,トークンレベルのトークンを経時的に連続的に更新する新しい追跡フレームワークを提案する。
本手法は最先端トラッカーよりも優れた性能を実現する。
- 参考スコア(独自算出の注目度): 19.913068958235957
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spatio-temporal context has become increasingly crucial for visual tracking. However, most existing approaches extract spatio-temporal cues via discrete sampling strategies, which inherently deviate from the continuity of spatio-temporal context, thereby deteriorating tracking performance. To address this challenge, we propose TLCTrack, a novel tracking framework that models token-level spatio-temporal context through continuously updated salient tokens, enabling more accurate target representation. Specifically, TLCTrack incorporates three components: Masked Unidirectional Attention (MUA), Spatial Salient Token Collection (SSTC), and Temporal Salient Token Bank (TSTB) modules. By explicitly integrating spatio-temporal context, MUA extracts discriminative targetaware spatial features in the search region. To avoid the negative impact of background on feature learning, SSTC progressively suppresses background interference, thereby enhancing target spatial representation. Finally, TSTB captures high-quality spatio-temporal information through continuous salient token updates. Extensive experiments on five benchmarks demonstrate that our method achieves superior performance over state-of-the-art trackers. Code and models are available at https://github.com/xiading123/TLCTrack.
- Abstract(参考訳): 空間的時間的文脈は、視覚的追跡にとってますます重要になっている。
しかし、既存のほとんどのアプローチは、時空間の連続性から本質的に逸脱する離散サンプリング戦略を通じて時空間的手がかりを抽出し、追跡性能を劣化させる。
そこで我々は,トークンレベルの時空間を連続的に更新し,より正確なターゲット表現を可能にする,新しい追跡フレームワークTLCTrackを提案する。
特にTLCTrackには、masked Unidirectional Attention (MUA)、Spatial Salient Token Collection (SSTC)、Temporal Salient Token Bank (TSTB)の3つのコンポーネントが含まれている。
時空間空間を明示的に統合することにより、MUAは探索領域における識別的ターゲット認識空間的特徴を抽出する。
特徴学習における背景の負の影響を避けるため、SSTCは背景干渉を徐々に抑制し、ターゲット空間表現を高める。
最後に、TSTBは、継続的な正当性トークン更新を通じて、高品質な時空間情報をキャプチャする。
5つのベンチマークの大規模な実験により,本手法は最先端トラッカーよりも優れた性能を発揮することが示された。
コードとモデルはhttps://github.com/xiading123/TLCTrackで公開されている。
関連論文リスト
- Decoupled Spatio-Temporal Consistency Learning for Self-Supervised Tracking [12.910676293067231]
ボックスアノテーションを不要にするために,textbftrackerというセルフスーパービジョントラッキングフレームワークを提案する。
GOT10K, LaSOT, TrackingNetデータセットのAUC(AO)スコアが25.3%, 20.4%, 14.8%向上した。
論文 参考訳(メタデータ) (2025-07-29T09:04:03Z) - Exploiting Multimodal Spatial-temporal Patterns for Video Object Tracking [53.33637391723555]
本研究では,STTrack というマルチモーダル空間時間追跡手法を提案する。
従来のパラダイムとは対照的に,マルチモーダル時間情報を含むトークン列を連続的に生成する時間状態生成器(TSG)を導入している。
これらの時間情報トークンは、次の時刻におけるターゲットの局所化を誘導し、ビデオフレーム間の長距離コンテキスト関係を確立し、ターゲットの時間軌道を捕捉するために使用される。
論文 参考訳(メタデータ) (2024-12-20T09:10:17Z) - ACTrack: Adding Spatio-Temporal Condition for Visual Object Tracking [0.5371337604556311]
視覚的物体追跡(VOT)において,物体の時間的関係を効果的にモデル化することが重要な課題である
既存の手法は外観に基づく類似性や長期関係モデリングによって追跡され、連続するフレーム間の時間的コンテキストは容易に見過ごされてしまう。
本稿では,大規模な記憶条件を持つ付加的前時間追跡フレームワークであるACTrackについて述べる。このフレームワークは,そのパラメータを凍結することにより,トレーニング済みバックボーンの品質と性能を保ち,トラッキングにおける時間関係をモデル化するためのトレーニング可能な軽量付加性ネットを作成する。
我々は空間的特徴と時間的順序の整合性を確保するための付加的なシアム畳み込みネットワークを設計する。
論文 参考訳(メタデータ) (2024-02-27T07:34:08Z) - LEAP-VO: Long-term Effective Any Point Tracking for Visual Odometry [53.5449912019877]
本稿では,LEAP(Long-term Effective Any Point Tracking)モジュールについて述べる。
LEAPは、動的トラック推定のために、視覚的、トラック間、時間的キューと慎重に選択されたアンカーを革新的に組み合わせている。
これらの特徴に基づき,強靭な視力計測システムLEAP-VOを開発した。
論文 参考訳(メタデータ) (2024-01-03T18:57:27Z) - Tracking Objects and Activities with Attention for Temporal Sentence
Grounding [51.416914256782505]
時間文 (TSG) は、意味的に自然言語のクエリと一致した時間セグメントを、トリミングされていないセグメントでローカライズすることを目的としている。
本稿では,(A)マルチモーダル・検索空間を生成するクロスモーダル・ターゲット・ジェネレータと(B)マルチモーダル・ターゲットの動作を追跡し,クエリ関連セグメントを予測するテンポラル・センセント・トラッカーとを含む,新しいテンポラル・センセント・トラッカー・ネットワーク(TSTNet)を提案する。
論文 参考訳(メタデータ) (2023-02-21T16:42:52Z) - SpOT: Spatiotemporal Modeling for 3D Object Tracking [68.12017780034044]
3Dマルチオブジェクトトラッキングは、常にすべてのモバイル時間を特定することを目的としている。
現在の3Dトラッキング手法は、抽象化された情報と限られた歴史に依存している。
本研究では,空間的情報と時間的情報の両方を活用するシーンの全体的表現を開発する。
論文 参考訳(メタデータ) (2022-07-12T21:45:49Z) - Continuity-Discrimination Convolutional Neural Network for Visual Object
Tracking [150.51667609413312]
本稿では,視覚オブジェクト追跡のためのContinuity-Discrimination Convolutional Neural Network (CD-CNN) という新しいモデルを提案する。
この問題に対処するため、cd-cnnは時間的遅れの概念に基づいた時間的外観連続性をモデル化する。
不正確なターゲットの定位とドリフトを緩和するために,新しい概念 object-centroid を提案する。
論文 参考訳(メタデータ) (2021-04-18T06:35:03Z) - DS-Net: Dynamic Spatiotemporal Network for Video Salient Object
Detection [78.04869214450963]
時間情報と空間情報のより効果的な融合のための新しい動的時空間ネットワーク(DSNet)を提案する。
提案手法は最先端アルゴリズムよりも優れた性能が得られることを示す。
論文 参考訳(メタデータ) (2020-12-09T06:42:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。