論文の概要: Clip-level Uncertainty and Temporal-aware Active Learning for End-to-End Multi-Object Tracking
- arxiv url: http://arxiv.org/abs/2605.09858v1
- Date: Mon, 11 May 2026 01:33:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.457557
- Title: Clip-level Uncertainty and Temporal-aware Active Learning for End-to-End Multi-Object Tracking
- Title(参考訳): エンド・ツー・エンド多目的追跡のためのクリップレベルの不確かさと時間認識能動学習
- Authors: Riku Inoue, Shogo Sato, Kazuhiko Murasaki, Tomoyasu Shimada, Toshihiko Nishimura, Ryuichi Tanida,
- Abstract要約: 動的環境におけるマルチオブジェクト追跡(MOT)は、時間とともに一貫したオブジェクトのアイデンティティを維持するために、堅牢な時間的推論に依存する。
トランスフォーマーベースのエンドツーエンドMOTモデルは、時間依存を明示的にモデル化することで、強力なパフォーマンスを達成する。
高ラベリングコストとビデオの強い冗長性を考えると、アクティブラーニング(AL)はアノテーション効率を改善する効果的なアプローチである。
- 参考スコア(独自算出の注目度): 1.2673946305606805
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-Object Tracking (MOT) in dynamic environments relies on robust temporal reasoning to maintain consistent object identities over time. Transformer-based end-to-end MOT models achieve strong performance by explicitly modeling temporal dependencies, yet training them requires extensive bounding-box and identity annotations. Given the high labeling cost and strong redundancy in videos, Active Learning (AL) is an effective approach to improve annotation efficiency. However, existing AL methods for MOT primarily operate at the frame level, which is structurally misaligned with modern end-to-end trackers whose inference and training rely on multi-frame clips. To bridge this gap, we formulate clip-level active learning and propose Clip-level Uncertainty and Temporal-aware Active Learning (CUTAL). In contrast to frame-based approaches, CUTAL scores each clip using uncertainty metrics derived from multi-frame predictions to capture inter-frame correspondence ambiguities, while enforcing temporal diversity to select an informative and non-redundant subset. Experiments show that CUTAL achieves stronger overall performance than baselines at the same label budgets across MeMOTR and SambaMOTR. Notably, CUTAL achieves performance comparable to full supervision for MeMOTR on both datasets using only 50% of the labeled training data.
- Abstract(参考訳): 動的環境におけるマルチオブジェクト追跡(MOT)は、時間とともに一貫したオブジェクトのアイデンティティを維持するために、堅牢な時間的推論に依存する。
トランスフォーマーベースのエンドツーエンドMOTモデルは、時間依存を明示的にモデル化することで、強力なパフォーマンスを達成するが、トレーニングには広範なバウンディングボックスとIDアノテーションが必要である。
高ラベリングコストとビデオの強い冗長性を考えると、アクティブラーニング(AL)はアノテーション効率を改善する効果的なアプローチである。
しかし、既存のMOTのALメソッドは、主にフレームレベルで動作しており、マルチフレームクリップに依存する現代的なエンドツーエンドトラッカーと構造的に不一致である。
このギャップを埋めるため、クリップレベルのアクティブラーニングを定式化し、クリップレベルの不確かさとテンポラルなアクティブラーニング(CUTAL)を提案する。
フレームベースのアプローチとは対照的に、CUTALは、各クリップを多フレーム予測から導出した不確実性メトリクスを用いてスコアし、フレーム間の対応のあいまいさを捉えながら、時間的多様性を強制し、情報的かつ非冗長なサブセットを選択する。
実験の結果、CUTALはMeMOTRとSambaMOTRをまたいで同じラベルの予算でベースラインよりも高い全体的な性能を達成することがわかった。
特にCUTALは、ラベル付きトレーニングデータの50%しか使用せず、両方のデータセット上でのMeMOTRの完全な監視に匹敵するパフォーマンスを実現している。
関連論文リスト
- COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm [59.26203051651017]
C-TAOはOpen-Vocabulary Multi-Object Tracking (OVMOT)のための最初の連続アノテーション付きトレーニングセットである
フレームワークボトルネックに対するCOVTrack++は,3つのモジュールによる検出とアソシエーションの双方向相互機構を実現するための相乗的フレームワークである。
TAOの実験では、新しいTAAは検証とテストセットで35.4%、30.5%に達し、新しいAssocAは4.8%、新しいLocAは5.8%向上した。
論文 参考訳(メタデータ) (2026-03-25T07:20:27Z) - From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Tracking [24.903851740154433]
本稿では,3つの視点にまたがってオブジェクトの識別性を高める明示的な特徴フレームワークを提案する。
実験によると、SpngeBobAはDanceTrack、SportsMOT、BFTなど、複数の挑戦的なMOTベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-02T04:04:39Z) - Unsupervised Online 3D Instance Segmentation with Synthetic Sequences and Dynamic Loss [52.28880405119483]
教師なしのオンライン3Dインスタンスのセグメンテーションは、基本的だが難しい課題だ。
UNITのような既存の手法はこの方向に進んできたが、訓練の多様性が制限されているままである。
本稿では,合成点雲列生成によるトレーニング分布の強化を目的とした新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T08:53:27Z) - StPR: Spatiotemporal Preservation and Routing for Exemplar-Free Video Class-Incremental Learning [79.44594332189018]
CIL(Class-Incremental Learning)は、以前取得した知識を使わずに、時間とともに新しいアクションカテゴリを継続的に学習するモデルの開発を目指している。
既存のアプローチでは、メモリとプライバシに関する懸念を忘れたり、あるいは時間的モデリングを無視する静的なイメージベースのメソッドを適用したりする。
本稿では,情報を明示的に切り離して保存する,統一的で非定型なVCILフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-20T06:46:51Z) - Interactive Test-Time Adaptation with Reliable Spatial-Temporal Voxels for Multi-Modal Segmentation [56.70910056845503]
マルチモーダルテストタイム適応(MM-TTA)は、補完的なマルチモーダル入力をオンライン形式で活用することにより、ラベルのないターゲットドメインにモデルを適応させる。
従来のMM-TTA法は, 時間的不整合によるフレームワイドの不安定な予測と, 信頼度誘導の仮定に反する不正確な予測の2つの大きな限界に悩まされていた。
Latte++は、より情報的な幾何学的対応によって不安定なフレーム単位の予測をより抑制し、対話型テスト時間適応(ITTA)は、努力を伴わない人間のフィードバックを促進するフレキシブルなアドオンである。
論文 参考訳(メタデータ) (2024-03-11T06:56:08Z) - T-MAE: Temporal Masked Autoencoders for Point Cloud Representation Learning [22.002220932086693]
本稿では,T-MAE (Temporal Masked Auto-Encoders) という,効果的な事前学習戦略を提案する。
T-MAEは、時間的隣接フレームとして入力を受け取り、時間的依存を学習する。
我々のT-MAE事前学習戦略は、注釈付きデータに対する需要を軽減する。
論文 参考訳(メタデータ) (2023-12-15T21:30:49Z) - Self-Supervised Multi-Object Tracking For Autonomous Driving From
Consistency Across Timescales [53.55369862746357]
自己管理型マルチオブジェクトトラッカーは、生のドメイン固有データから学習できるという大きな可能性を秘めている。
しかし、その再識別精度は、監督対象よりも低い。
本稿では,複数の連続フレームから再同定特徴を自己教師付きで学習できる学習目標を提案する。
論文 参考訳(メタデータ) (2023-04-25T20:47:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。