論文の概要: VLA-ReID: Video-Level Association for Re-Identification in Multi-Object Tracking with Highly Similar Objects
- arxiv url: http://arxiv.org/abs/2607.17157v1
- Date: Sun, 19 Jul 2026 09:27:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.384379
- Title: VLA-ReID: Video-Level Association for Re-Identification in Multi-Object Tracking with Highly Similar Objects
- Title(参考訳): VLA-ReID: 類似度の高い多物体追跡における再同定のためのビデオレベルアソシエーション
- Abstract要約: マルチオブジェクトトラッキング(MOT)は、ビデオ内の複数のオブジェクトをローカライズし、そのアイデンティティを時間とともに保存することを目的としている。
既存のトラッカーは、単一インスタンス割り当てによって訓練された再識別(re-ID)モデルに依存している。
本稿では,ビデオレベルアソシエーションモデリングとしてre-IDを再構成するビデオレベルアソシエーション・リID(VLA-ReID)を提案する。
- 参考スコア(独自算出の注目度): 6.909117285273132
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-object tracking (MOT) aims to localize multiple objects in videos while preserving their identities over time. Long-term identity preservation remains difficult when objects are small, densely distributed, and highly similar in appearance, as in bee swarm scenes. Existing trackers rely on re-identification (re-ID) models trained through single-instance assignment (instance-level querying). At inference, however, MOT requires global assignment between multiple trajectories and detections, corresponding to video-level querying. This training-inference mismatch can cause identity switches among visually similar objects. Existing approaches also often require substantial additional annotations to enhance appearance discrimination. We propose Video-Level Association re-ID (VLA-ReID), which reformulates re-ID as video-level association modeling. It uses aggregated historical trajectory features as queries and all current-frame detections as candidates, enabling direct optimization of their global association at each frame. In addition, Frame-Common Appearance Estimation (FCAE) estimates a common appearance direction from current-frame detections, while Common-Appearance Suppression (CAS) removes the corresponding component along this direction from trajectory and detection features. This amplifies discriminative differences among highly similar objects without additional annotations. Experiments on BEE24 show that VLA-ReID improves HOTA by 1.1, MOTA by 0.3, AssR by 2.6, AssA by 0.7, and IDF1 by 0.8 over state-of-the-art trackers, while reducing identity switches by 28%. These results demonstrate the effectiveness of video-level re-ID modeling for appearance-based association in MOT.
- Abstract(参考訳): マルチオブジェクトトラッキング(MOT)は、ビデオ内の複数のオブジェクトをローカライズし、そのアイデンティティを時間とともに保存することを目的としている。
ミツバチの群れのシーンのように、被写体が小さく、密度が高く、外観が非常によく似ている場合、長期的なアイデンティティの保存は困難である。
既存のトラッカーは、単一インスタンス割り当て(インスタンスレベルのクエリ)によってトレーニングされた再識別(re-ID)モデルに依存している。
しかし、推測では、MOTはビデオレベルのクエリに対応する複数のトラジェクトリと検出をグローバルに割り当てる必要がある。
このトレーニング推論ミスマッチは、視覚的に類似したオブジェクト間のアイデンティティスイッチを引き起こす可能性がある。
既存のアプローチはしばしば、外見の識別を強化するために、かなりの追加のアノテーションを必要とする。
本稿では,ビデオレベルアソシエーションモデリングとしてre-IDを再構成するビデオレベルアソシエーション・リID(VLA-ReID)を提案する。
クエリとして集計された履歴トラジェクトリ機能を使用し、すべての現在のフレーム検出を候補として、各フレームでのグローバルアソシエーションの直接最適化を可能にする。
さらに、FCAEは、現在のフレーム検出から共通出現方向を推定し、CAS(Common-Appearance Suppression)は、この方向に沿って対応する成分を軌道や検出特徴から除去する。
これは、アノテーションを追加せずに非常に類似したオブジェクト間の差別的な違いを増幅する。
BEE24の実験では、VLA-ReIDはHOTAを1.1倍、MOTAを0.3倍、AssRを2.6倍、AssAを0.7倍、IDF1を0.8倍改善し、IDスイッチを28%削減した。
これらの結果は、MOTの外観に基づくアソシエーションにおけるビデオレベルのre-IDモデリングの有効性を示す。
関連論文リスト
- REMIND: RE-Identification with Memory for INDoor Navigation [39.146761527401424]
モノクロRGB画像からの屋内ジェネリックオブジェクトの長期的多目的再識別のためのオンライントラッカー。
視覚的認知の証拠によって、人間は明示的な自己ローカライゼーションではなく、蓄積した外観の親しみと空間的コンテキストに依存している。
ScanNet++では、すべてのシーンで1つのエンドツーエンド検出を除いて、すべての設定で最高のIDF1を達成している。
論文 参考訳(メタデータ) (2026-07-10T10:30:50Z) - Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory [79.01059178883817]
IAMFlowはトレーニング不要のID対応メモリフレームワークで、永続的なエンティティのIDを明示的にモデル化し追跡する。
VLMは、レンダリングフレームから属性を非同期に検証し、洗練し、暗黙の類似性ベースのマッチングの代わりに明示的なエンティティ追跡を可能にする。
NarraStream-Benchは,6次元にまたがる324のマルチプロンプトスクリプトを備えた,ナラストリームビデオ生成のためのベンチマークである。
論文 参考訳(メタデータ) (2026-05-18T17:54:34Z) - COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm [59.26203051651017]
C-TAOはOpen-Vocabulary Multi-Object Tracking (OVMOT)のための最初の連続アノテーション付きトレーニングセットである
フレームワークボトルネックに対するCOVTrack++は,3つのモジュールによる検出とアソシエーションの双方向相互機構を実現するための相乗的フレームワークである。
TAOの実験では、新しいTAAは検証とテストセットで35.4%、30.5%に達し、新しいAssocAは4.8%、新しいLocAは5.8%向上した。
論文 参考訳(メタデータ) (2026-03-25T07:20:27Z) - From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Tracking [24.903851740154433]
本稿では,3つの視点にまたがってオブジェクトの識別性を高める明示的な特徴フレームワークを提案する。
実験によると、SpngeBobAはDanceTrack、SportsMOT、BFTなど、複数の挑戦的なMOTベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-02T04:04:39Z) - History-Aware Transformation of ReID Features for Multiple Object Tracking [17.15627396627977]
本稿では,ReID特徴量に対する履歴認識変換を用いて,より識別的な外観表現を実現することを提案する。
実験の結果,このトレーニングフリープロジェクションにより,機能のみのトラッカーが大幅に向上し,より優れたトラッカー性能が達成できることがわかった。
論文 参考訳(メタデータ) (2025-03-16T16:34:40Z) - Object-Centric Multiple Object Tracking [124.30650395969126]
本稿では,多目的追跡パイプラインのためのビデオオブジェクト中心モデルを提案する。
オブジェクト中心のスロットを検出出力に適応するインデックスマージモジュールと、オブジェクトメモリモジュールで構成される。
オブジェクト中心学習に特化して、オブジェクトのローカライゼーションと機能バインディングのためのスパース検出ラベルしか必要としない。
論文 参考訳(メタデータ) (2023-09-01T03:34:12Z) - Scalable Video Object Segmentation with Identification Mechanism [125.4229430216776]
本稿では,半教師付きビデオオブジェクト(VOS)のスケーラブルで効果的なマルチオブジェクトモデリングを実現する上での課題について検討する。
AOT(Associating Objects with Transformers)とAOST(Associating Objects with Scalable Transformers)の2つの革新的なアプローチを提案する。
当社のアプローチは最先端の競合に勝って,6つのベンチマークすべてにおいて,例外的な効率性とスケーラビリティを一貫して示しています。
論文 参考訳(メタデータ) (2022-03-22T03:33:27Z) - Target-Aware Object Discovery and Association for Unsupervised Video
Multi-Object Segmentation [79.6596425920849]
本稿では,教師なしビデオマルチオブジェクトセグメンテーションの課題について述べる。
より正確で効率的な時間区分のための新しいアプローチを紹介します。
DAVIS$_17$とYouTube-VISに対する提案手法を評価した結果,セグメント化精度と推論速度の両方において最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2021-04-10T14:39:44Z) - Unsupervised Pretraining for Object Detection by Patch Reidentification [72.75287435882798]
教師なし表現学習は、オブジェクトディテクタの事前トレーニング表現で有望なパフォーマンスを実現します。
本研究では,オブジェクト検出のための簡易かつ効果的な表現学習手法であるパッチ再識別(Re-ID)を提案する。
私たちの方法は、トレーニングの反復やデータパーセンテージなど、すべての設定でCOCOの同等を大幅に上回ります。
論文 参考訳(メタデータ) (2021-03-08T15:13:59Z) - Attribute-aware Identity-hard Triplet Loss for Video-based Person
Re-identification [51.110453988705395]
ビデオベースの人物識別(Re-ID)は重要なコンピュータビジョンタスクである。
属性認識型ID-hard Triplet Loss (AITL) と呼ばれる新しいメトリクス学習手法を提案する。
ビデオベースのRe-IDの完全なモデルを実現するために,Attribute-driven Spatio-Temporal Attention (ASTA) 機構を備えたマルチタスクフレームワークを提案する。
論文 参考訳(メタデータ) (2020-06-13T09:15:38Z) - Joint Detection and Tracking in Videos with Identification Features [36.55599286568541]
本稿では,ビデオ検出,追跡,再識別機能の最初の共同最適化を提案する。
提案手法はMOTの最先端に到達し,オンライントラッカーにおけるUA-DETRAC'18追跡課題のうち,第1位,第3位にランクインした。
論文 参考訳(メタデータ) (2020-05-21T21:06:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。