論文の概要: Cross-Modal UAV Object Tracking: State-Aware Representation Learning and A Unified Benchmark
- arxiv url: http://arxiv.org/abs/2607.18768v1
- Date: Tue, 21 Jul 2026 06:52:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.339427
- Title: Cross-Modal UAV Object Tracking: State-Aware Representation Learning and A Unified Benchmark
- Title(参考訳): クロスモーダルなUAVオブジェクト追跡:状態認識表現学習と統一ベンチマーク
- Abstract要約: 無人航空機(UAV)の物体追跡は、広く実用化された研究分野として人気を博している。
通信帯域、計算資源、電力消費の制約により、現在のシステムは、1つのモダリティを活性化し、ロバストなトラッキングを維持するためにモダリティを切り替えることが多い。
SARLAと呼ばれる新しいステートアウェア表現学習手法を提案する。これは、現在のフレームとテンプレートと最終フレームとの不整合なモダリティ状態を認識し、外観と位置の急激な変化に対応する。
- 参考スコア(独自算出の注目度): 22.8308207922193
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unmanned Aerial Vehicle (UAV) object tracking has emerged as a popular research field with broad practical applications. Modern UAVs are increasingly equipped with both visible light and thermal infrared sensors. However, due to constraints in communication bandwidth, computational resources and power consumption, current systems often activate one modality and switch between modalities to maintain robust tracking in complex scenarios. Such modality switch inevitably leads to significant appearance change and sudden spatial shift, posing great challenges for existing tracking algorithms. To handle this problem, we propose a novel State-Aware Representation Learning Approach called SARLA, which perceives the inconsistent modality states of current frame with template and last frame in the target representations to adapt to the sudden changes in both appearance and position, for robust cross-modal object tracking. In particular, we propose the Modality State Aware Representation Module (MSARM) and Spatial State Aware Representation Module (SSARM). MSARM guides the model to learn appearance correlation, bridging the modality gap, while SSARM models cross-frame spatial correlation to mitigate sudden spatial shift impacts. In addition, we design a spatial shift prediction loss to further handle the effects of spatial variation caused by modality switch. To promote the development of this research field, we establish a large-scale video benchmark called CM-UOT, which consists of 1079 cross-modal sequences with an average video length greater than 621 frames and encompasses over 671K frames in total. Extensive experiments on CM-UOT dataset demonstrate the superior performance of the proposed SARLA against 20 excellent tracking methods. The source code, datasets, and evaluation protocols associated with this work are publicly available at: https://github.com/hongsmile365/sarla-.
- Abstract(参考訳): 無人航空機(UAV)の物体追跡は、広く実用化された研究分野として人気を博している。
現代のUAVは、可視光と熱赤外センサーの両方を備えている。
しかし、通信帯域幅、計算資源、電力消費の制約により、現在のシステムは複雑なシナリオにおいて堅牢なトラッキングを維持するために、1つのモダリティを活性化し、モダリティを切り替えることが多い。
このようなモダリティスイッチは、必然的に大きな外観変化と突然の空間シフトをもたらし、既存の追跡アルゴリズムに大きな課題を生じさせる。
この問題を解決するために,SARLAと呼ばれる新しいステートアウェア表現学習手法を提案する。これは,ターゲット表現におけるテンプレートと最終フレームとの整合性を認識し,外見と位置の急激な変化に対応する。
特に,Modality State Aware Representation Module (MSARM)とSpatial State Aware Representation Module (SSARM)を提案する。
MSARMは外観相関を学習し、モダリティギャップを埋める一方で、SSARMは突然の空間シフトの影響を軽減するために、フレーム間の空間相関をモデル化する。
さらに,モダリティスイッチによる空間変動の影響を更に扱えるように,空間シフト予測損失を設計する。
この研究分野の発展を促進するため,CM-UOTと呼ばれる大規模ビデオベンチマークを構築し,平均ビデオ長が621フレームを超える1079のクロスモーダルシーケンスと,合計671Kフレームを網羅する。
CM-UOTデータセットの大規模な実験は、提案したSARLAの20の優れた追跡手法に対する優れた性能を示す。
この作業に関連するソースコード、データセット、評価プロトコルは、https://github.com/hongsmile365/sarla-.comで公開されている。
関連論文リスト
- Hypergraph-State Collaborative Reasoning for Multi-Object Tracking [63.32950991964095]
複数の相関オブジェクト間の共同推論による動き推定を向上する協調推論フレームワークを提案する。
類似の運動状態を持つ物体同士を互いに拘束し、互いに洗練させることで、我々のフレームワークはノイズの軌道を安定させ、目標を遮蔽しても可塑性運動の連続性を推測する。
論文 参考訳(メタデータ) (2026-04-14T12:37:39Z) - Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping [61.459927600301654]
マルチコンディション制御は従来のコンカデント・アンド・アットエンドの戦略によってボトルネックとなる。
分析の結果,これらの相互作用の多くは空間的にも意味的にも冗長であることがわかった。
本稿では,これらの冗長性を解消するための高効率なフレームワークであるPKAを提案する。
論文 参考訳(メタデータ) (2026-02-06T16:39:10Z) - Surveillance Video-Based Traffic Accident Detection Using Transformer Architecture [2.621034368312571]
交通事故は、人口増加、都市化、自動車化による死亡率の増加により、世界的死亡率の主要な原因となっている。
事故検出のための伝統的なコンピュータ手法は、限られた理解と貧弱なクロスドメインの一般化を伴う。
本研究では,事前抽出した空間映像特徴を用いた変圧器アーキテクチャに基づく事故検出モデルを提案する。
論文 参考訳(メタデータ) (2025-12-12T07:57:36Z) - A Tri-Modal Dataset and a Baseline System for Tracking Unmanned Aerial Vehicles [74.8162337823142]
MM-UAVはMulti-Modal UAV Trackingの最初の大規模ベンチマークである。
データセットは30以上の挑戦的なシナリオにまたがっており、1,321の同期マルチモーダルシーケンスと280万以上の注釈付きフレームがある。
データセットを伴って、我々は新しいマルチモーダルマルチUAV追跡フレームワークを提供する。
論文 参考訳(メタデータ) (2025-11-23T08:42:17Z) - CADTrack: Learning Contextual Aggregation with Deformable Alignment for Robust RGBT Tracking [68.71826342377004]
RGB-Thermal (RGBT) トラッキングは、堅牢な全天候物体追跡のために可視および熱赤外モードを活用することを目的としている。
既存のRGBTトラッカーはモダリティの相違を解決するのに苦労している。
RGBT追跡のためのCADTrackと呼ばれる,変形可能なアライメントによるコンテキストアグリゲーション(Contextual Aggregation)を提案する。
論文 参考訳(メタデータ) (2025-11-22T08:10:02Z) - Dynamic Semantic-Aware Correlation Modeling for UAV Tracking [43.811226798454214]
UAV追跡は、災害救助、環境モニタリング、物流輸送といったシナリオに広く適用することができる。
既存のUAV追跡手法は、主にスピードを強調し、セマンティック・アウェアネスの探索を欠いている。
この問題に対処するために,動的セマンティック・アウェアリング・リレーショナル・モデリング・トラッキング・フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-24T11:28:06Z) - Tracking the Unstable: Appearance-Guided Motion Modeling for Robust Multi-Object Tracking in UAV-Captured Videos [58.156141601478794]
マルチオブジェクトトラッキング(UAVT)は、ビデオのフレーム間で一貫したアイデンティティを維持しながら、複数のオブジェクトを追跡することを目的としている。
既存の手法は、通常、動作キューと外観を別々にモデル化し、それらの相互作用を見渡して、最適下追跡性能をもたらす。
本稿では、AMC行列とMTCモジュールの2つの主要コンポーネントを通して、外観と動きの手がかりを利用するAMOTを提案する。
論文 参考訳(メタデータ) (2025-08-03T12:06:47Z) - DINO-CoDT: Multi-class Collaborative Detection and Tracking with Vision Foundation Models [11.34839442803445]
道路利用者を対象とした多クラス協調検出・追跡フレームワークを提案する。
まず,大域的空間注意融合(GSAF)モジュールを用いた検出器を提案する。
次に,視覚基盤モデルを用いた視覚的セマンティクスを活用し,IDSW(ID SWitch)エラーを効果的に低減するトラックレットRe-IDentification(REID)モジュールを提案する。
論文 参考訳(メタデータ) (2025-06-09T02:49:10Z) - Adaptive State-Space Mamba for Real-Time Sensor Data Anomaly Detection [2.922256022514318]
本稿では,リアルタイムセンサデータ異常検出のためのemphAdaptive State-Space Mambaフレームワークを提案する。
我々のアプローチは、迅速で信頼性の高い検出機能を必要とする他の時系列タスクに容易に適用できます。
論文 参考訳(メタデータ) (2025-03-26T21:37:48Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z) - Sports-Traj: A Unified Trajectory Generation Model for Multi-Agent Movement in Sports [53.637837706712794]
任意の軌道をマスク入力として処理する統一軌道生成モデルUniTrajを提案する。
具体的には,空間特徴抽出のためのトランスフォーマーエンコーダ内に埋め込まれたゴースト空間マスキング(GSM)モジュールを紹介する。
バスケットボールU,サッカーU,サッカーUの3つの実践的スポーツデータセットをベンチマークして評価を行った。
論文 参考訳(メタデータ) (2024-05-27T22:15:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。