論文の概要: CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking
- arxiv url: http://arxiv.org/abs/2607.25239v1
- Date: Tue, 28 Jul 2026 03:29:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.694021
- Title: CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking
- Title(参考訳): CD-RMOT-Bench: クロスドメイン参照マルチオブジェクトトラッキングのベンチマーク
- Abstract要約: クロスドメイン参照マルチオブジェクト追跡(CD-RMOT)は、RMOTモデルが、異なる視覚条件のラベル付き対象領域において、自然言語表現を確実に追従できるかどうかを評価する新しい問題である。
CD-RMOT-Benchは、実際のクリアドメイン参照追跡データ、アライメントされたデジタルツイン変種、および真の悪いドメインビデオを組み合わせた統合ベンチマークである。
広範囲な実験により、ドメインシフトはRMOT性能を著しく低下させ、それは単にオブジェクト検出エラーによって発生するのではなく、不安定な表現条件の時間的関連とターゲット選択によってより重要となる。
- 参考スコア(独自算出の注目度): 18.30427236092477
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Referring multi-object tracking (RMOT) extends tracking from category-driven perception to language-guided understanding by grounding object trajectories in natural-language expressions. Despite recent progress, existing RMOT studies are largely conducted under in-domain settings, leaving the robustness of language-conditioned tracking under inevitable visual domain shifts unexplored. In this paper, we study Cross-Domain Referring Multi-Object Tracking (CD-RMOT), a new and challenging problem that evaluates whether an RMOT model trained on a labeled source domain can reliably follow natural-language expressions in an unlabeled target domain with different visual conditions. To support systematic study, we construct CD-RMOT-Bench, a unified benchmark that combines real clear-domain referring tracking data, aligned digital-twin variants, and real adverse-domain videos. CD-RMOT-Bench enables both controlled weather/viewpoint shift analysis and realistic synthetic-real transfer evaluation under a shared RMOT protocol. Further, we provide a Query-Centric Adaptation (QCA) framework, designed to stabilize the query space that bridges visual trajectories and referring expressions. Extensive experiments reveal that domain shifts severely degrade RMOT performance, where the failure is not merely caused by object detection errors but more critically by unstable expression-conditioned temporal association and target selection. QCA establishes a strong baseline, while CD-RMOT-Bench opens a new direction for robust language-guided tracking across visual domains.
- Abstract(参考訳): Referring Multi-Object Tracking (RMOT) は、カテゴリー駆動の知覚から、自然言語表現における対象軌跡の接地による言語誘導的理解まで、追跡を拡張している。
近年の進歩にもかかわらず、既存のRMOT研究は主にドメイン内の設定の下で行われており、言語条件付きトラッキングの堅牢性は、不可避な視覚的ドメインシフトの下で探索されないままである。
本稿では,ラベル付きソースドメイン上でトレーニングされたRMOTモデルが,異なる視覚条件のラベル付きターゲットドメインにおける自然言語表現を確実に追従できるかどうかを評価する,新たな課題であるクロスドメイン参照マルチオブジェクト追跡(CD-RMOT)について検討する。
系統的な研究を支援するため、実際のクリアドメイン参照追跡データ、アライメントされたデジタルツイン変種、実際の悪ドメインビデオを組み合わせた統合ベンチマークCD-RMOT-Benchを構築した。
CD-RMOT-Benchは、制御された天気/視点シフト解析と、共有RMOTプロトコル下でのリアルな合成-現実的伝達評価の両方を可能にする。
さらに、視覚的トラジェクトリと参照表現をブリッジするクエリ空間を安定化するクエリ中心適応(QCA)フレームワークを提供する。
広範囲な実験により、ドメインシフトはRMOT性能を著しく低下させ、それは単にオブジェクト検出エラーによって発生するのではなく、不安定な表現条件の時間的関連とターゲット選択によってより重要となる。
QCAは強力なベースラインを確立し、CD-RMOT-Benchはビジュアルドメインをまたいだ堅牢な言語誘導トラッキングのための新しい方向を開く。
関連論文リスト
- VPRef: A Cross-Domain Benchmark for Referring Remote Sensing Image Segmentation [17.658559673931965]
本稿では,46,972の言語画像アノテーションを付加した最初のクロスドメインRRSISベンチマークを確立する。
我々は,ローランド適応 (LoRA) を用いて,Segment Anything Model (SAM3) に固定されたパラメータ効率の良いドメイン適応ベースラインを開発する。
本フレームワークは,擬似ラベル駆動型自己学習による視覚分布の相違に対処し,ランダムな多粒性テキストプロンプトミキシングによるテキスト論理のドリフトに対処する。
論文 参考訳(メタデータ) (2026-09-15T01:18:06Z) - Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models [154.39583176906893]
大規模言語モデル(ML)は高度な理解を持ち、シーンにおける幻覚の傾向が高い。
これは、時間的モニタリングの失敗、オブジェクトの動的アイデンティティ、状態、そして時間とともに関係を永続的に追跡する能力に起因している、と我々は主張する。
既存のベンチマークでは、局所的な視覚的手がかりや統計的先行によってしばしば解決される1つの最終回答クエリに頼って、この欠陥を曖昧にしている。
論文 参考訳(メタデータ) (2026-05-09T14:32:36Z) - VFM$^{4}$SDG: Unveiling the Power of VFMs for Single-Domain Generalized Object Detection [33.39250067795076]
現実のシナリオでは、天気、照明、撮像条件の連続的な変化は、大きなドメインシフトを引き起こす。
一般化オブジェクト検出(SDGOD)のための二元学習フレームワークを提案する。
符号化段階では,オブジェクト・バックグラウンドとインスタンス間モデリングの堅牢性を高めるために,クロスドメイン安定優先蒸留を提案する。
復号段階では,セマンティック・コンテキスト優先型クエリ拡張を提案する。
論文 参考訳(メタデータ) (2026-04-23T10:04:36Z) - RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection [38.069086560563285]
マルチモーダルフェイクニュースビデオ検出は、オンライン情報の信頼性を維持するための重要な研究方向である。
既存の研究は、主にマルチモーダルな特徴融合表現を構築したり、事前訓練された言語モデルを利用したりすることで、コンテンツの信頼性を検証する。
本稿では,これらの制約を克服する新しいRASR(Retrieval-Augmented Semantic Reasoning)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-08T05:03:34Z) - RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation [71.2136732268131]
RGB-Thermal(RGBT)トラッキングは、多様な環境条件をまたいだ堅牢なオブジェクトローカライゼーションを実現することを目的としている。
既存のRGBTトラッカーは、ターゲットモデリングのための初期フレームの視覚情報のみに依存している。
堅牢なRGBTトラッキングのための新しい検索拡張フレームワークであるRAGTrackを提案する。
論文 参考訳(メタデータ) (2026-03-04T01:02:04Z) - Self-Supervised Visual Prompting for Cross-Domain Road Damage Detection [21.137567686181438]
私たちのフレームワークは、ラベルなしでターゲットドメインを視覚的に調査する、自己管理型のフレームワークです。
強い監督、自己監督、適応のベースラインを 常に上回っています
これらの結果は、スケーラブルで適応的な視覚検査システムを構築するための実践的な方向性として、自己監督的プロンプトを強調している。
論文 参考訳(メタデータ) (2025-11-16T01:28:45Z) - See No Evil: Adversarial Attacks Against Linguistic-Visual Association in Referring Multi-Object Tracking Systems [21.34084466103555]
本稿では,RMOTモデルの参照マッチング機構の統一化を阻止する新しい逆向きフレームワークVEILを提案する。
デジタル・物理的摂動は追跡ロジックの信頼性を損なう可能性を示し、トラックIDスイッチや用語を誘導する。
論文 参考訳(メタデータ) (2025-09-02T07:17:32Z) - Cross-Domain Few-Shot Object Detection via Enhanced Open-Set Object Detector [72.05791402494727]
本稿では,CD-FSODを用いたクロスドメイン小ショット検出法について検討する。
最小限のラベル付き例で、新しいドメインのための正確なオブジェクト検出器を開発することを目的としている。
論文 参考訳(メタデータ) (2024-02-05T15:25:32Z) - Topic-driven Distant Supervision Framework for Macro-level Discourse
Parsing [72.14449502499535]
テキストの内部修辞構造を解析する作業は、自然言語処理において難しい問題である。
近年のニューラルモデルの発展にもかかわらず、トレーニングのための大規模で高品質なコーパスの欠如は大きな障害となっている。
近年の研究では、遠方の監督を用いてこの制限を克服しようと試みている。
論文 参考訳(メタデータ) (2023-05-23T07:13:51Z) - Unsupervised Domain Adaptive 3D Detection with Multi-Level Consistency [90.71745178767203]
ディープラーニングに基づく3Dオブジェクト検出は、大規模な自律走行データセットの出現によって、前例のない成功を収めた。
既存の3Dドメイン適応検出手法は、しばしばターゲットのドメインアノテーションへの事前アクセスを前提とします。
我々は、ソースドメインアノテーションのみを利用する、より現実的な、教師なしの3Dドメイン適応検出について研究する。
論文 参考訳(メタデータ) (2021-07-23T17:19:23Z) - Structured Domain Adaptation with Online Relation Regularization for
Unsupervised Person Re-ID [62.90727103061876]
Unsupervised Domain adapt(UDA)は、ラベル付きソースドメインデータセットでトレーニングされたモデルを、ラベルなしのターゲットドメインデータセットに適応させることを目的としている。
本稿では,オンライン関係整合性正規化項を用いたエンドツーエンドなドメイン適応フレームワークを提案する。
提案手法は,複数のUDAタスクにおける人物再IDの最先端性能を実現することを目的としている。
論文 参考訳(メタデータ) (2020-03-14T14:45:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。