論文の概要: Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking
- arxiv url: http://arxiv.org/abs/2608.00847v1
- Date: Sat, 01 Aug 2026 19:58:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.956305
- Title: Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking
- Title(参考訳): ツールとしてのモデル: 統一型マルチモーダルビジュアルトラッキングのためのエージェントコーディネートフレームワーク
- Abstract要約: ACTrackは異種モデルをイベントトリガー機構の下で起動可能なツールとして扱うエージェントコーディネートフレームワークである。
ACTrackは8つのRGBベンチマークにおいて最強で最大のトラッカーをはるかに上回っていることを示す。
- 参考スコア(独自算出の注目度): 46.37628260203197
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most current visual trackers adopt a matching-based architecture trained exclusively on tracking datasets, whose performance gains depend heavily on the length of the input context, and have now reached a bottleneck. While high-performance tracking increasingly relies on foundation models, existing methods use them monolithically, adapting a foundation model into a tracker or modify a segmentation foundation model into a tracking pipeline, which fails to exploit complementary strengths. Matching-based trackers excel at instance-level correspondence but lack semantic discrimination and fine-grained foreground perception, whereas segmentation foundation models produce precise masks yet struggle with instance discrimination and multimodal extension. Both paradigms also lack error-correction capabilities for long-term tracking. To address these issues, we propose ACTrack, an agentic coordination framework that treats heterogeneous models as invocable tools under an event-triggered mechanism. ACTrack coordinates a Tracker-based Instance Matching Tool for target discrimination, a SAM3 Motion Tool for mask-derived motion priors, a SAM3 Perception Tool for detecting distractors and instance-conflict cues, and a VLM Reprompt Tool activated only under persistent conflict to mitigate error accumulation. We design a complete tool-invocation trigger mechanism and an inter-tool coordination mechanism, enabling the complementary strengths of different model tools to be fully integrated. Experiments show that ACTrack substantially surpasses the strongest and the largest trackers on eight RGB benchmarks. Furthermore, a parameter-efficient adaptation strategy enables parameter sharing and reuse across tools, achieving unified multimodal tracking with only 30\% trainable parameters while substantially outperforming prior methods on multimodal benchmarks such as LasHeR, VisEvent, TNL2K, and DepthTrack.
- Abstract(参考訳): 現在のビジュアルトラッカーのほとんどは、データセットのトラッキングに特化してトレーニングされたマッチングベースのアーキテクチャを採用しており、そのパフォーマンスは入力コンテキストの長さに大きく依存しており、ボトルネックに達している。
高性能なトラッキングはファンデーションモデルにますます依存するが、既存の手法ではそれをモノリシックに使用し、ファンデーションモデルをトラッカーに適合させたり、セグメンテーション基盤モデルをトラックパイプラインに修正する。
マッチングベースのトラッカーは、インスタンスレベルの対応において優れているが、セグメンテーション基礎モデルは、インスタンスの識別とマルチモーダル拡張に苦慮していない正確なマスクを生成する。
どちらのパラダイムも、長期追跡のためのエラー訂正機能が欠けている。
これらの問題に対処するために、イベントトリガー機構の下で不均一なモデルを起動可能なツールとして扱うエージェント協調フレームワークACTrackを提案する。
ACTrackは、ターゲット識別のためのトラッカーベースのインスタンスマッチングツール、マスク由来の動作前処理のためのSAM3モーションツール、イントラクタとインスタンスコンフリクトのキューを検出するSAM3パーセプションツール、エラーの蓄積を緩和するために永続的なコンフリクトの下でのみ起動されるVLM Repromptツールをコーディネートする。
我々は,ツール起動起動機構とツール間協調機構を設計し,異なるモデルツールの相補的強みを完全に統合できるようにする。
実験によると、ACTrackは8つのRGBベンチマークで最強で最大のトラッカーをはるかに上回っている。
さらに、パラメータ効率のよい適応戦略により、ツール間のパラメータ共有と再利用が可能になり、トレーニング可能なパラメータがわずか30%の統一マルチモーダルトラッキングを実現すると同時に、LasHeR、VisEvent、TNL2K、DepthTrackなどのマルチモーダルベンチマークにおいて、事前メソッドを大幅に上回っている。
関連論文リスト
- GenTrack3: Hybrid Stochastic-Deterministic Online Multi-Object Tracking with Cluster-Aware Association [3.259045978275386]
マルチオブジェクト追跡(MOT)は、オブジェクトが動的にシーンに入り、去るときに、一貫したターゲットIDを維持する。
本稿では,不確実性下でのロバストなトラッキングを実現するために,決定論的および推論原理を統合したオンラインフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-10T13:16:17Z) - Unified Multimodal Visual Tracking with Dual Mixture-of-Experts [48.73939694967044]
OneV2は、あらゆるモダリティのエンドツーエンドトレーニングを可能にする統合マルチモーダルトラッキングフレームワークである。
OneV2は5つのRGB+Xトラッキングタスクと12のベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-05-05T13:05:50Z) - A Tri-Modal Dataset and a Baseline System for Tracking Unmanned Aerial Vehicles [74.8162337823142]
MM-UAVはMulti-Modal UAV Trackingの最初の大規模ベンチマークである。
データセットは30以上の挑戦的なシナリオにまたがっており、1,321の同期マルチモーダルシーケンスと280万以上の注釈付きフレームがある。
データセットを伴って、我々は新しいマルチモーダルマルチUAV追跡フレームワークを提供する。
論文 参考訳(メタデータ) (2025-11-23T08:42:17Z) - CAMELTrack: Context-Aware Multi-cue ExpLoitation for Online Multi-Object Tracking [68.24998698508344]
CAMELはコンテキスト対応型マルチキューExpLoitationのための新しいアソシエイトモジュールである。
エンド・ツー・エンドの検知・バイ・トラック方式とは異なり,本手法は軽量かつ高速にトレーニングが可能であり,外部のオフ・ザ・シェルフモデルを活用することができる。
提案するオンライントラッキングパイプラインであるCAMELTrackは,複数のトラッキングベンチマークで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-05-02T13:26:23Z) - SynCL: A Synergistic Training Strategy with Instance-Aware Contrastive Learning for End-to-End Multi-Camera 3D Tracking [34.90147791481045]
SynCLは、検出と追跡のためのマルチタスク学習を共用するために設計された、新しいプラグアンドプレイのシナジスティックトレーニング戦略である。
重み付きクロスアテンションに基づくデコーダのためのタスク固有ハイブリッドマッチングモジュールを提案する。
また、追跡クエリに対する自己中心的な注意の障壁を突破するために、インスタンス対応のContrastive Learningを導入します。
論文 参考訳(メタデータ) (2024-11-11T08:18:49Z) - You Only Need Two Detectors to Achieve Multi-Modal 3D Multi-Object Tracking [9.20064374262956]
提案手法は,2次元検出器と3次元検出器のみを用いて,ロバストなトラッキングを実現する。
多くの最先端のTBDベースのマルチモーダルトラッキング手法よりも正確であることが証明されている。
論文 参考訳(メタデータ) (2023-04-18T02:45:18Z) - Unified Transformer Tracker for Object Tracking [58.65901124158068]
異なるシナリオにおけるトラッキング問題に1つのパラダイムで対処するために,UTT(Unified Transformer Tracker)を提案する。
SOT(Single Object Tracking)とMOT(Multiple Object Tracking)の両方を対象とするトラックトランスフォーマーを開発した。
論文 参考訳(メタデータ) (2022-03-29T01:38:49Z) - Learning Dynamic Compact Memory Embedding for Deformable Visual Object
Tracking [82.34356879078955]
本稿では,セグメント化に基づく変形可能な視覚追跡手法の識別を強化するために,コンパクトなメモリ埋め込みを提案する。
DAVIS 2017ベンチマークでは,D3SやSiamMaskなどのセグメンテーションベースのトラッカーよりも優れている。
論文 参考訳(メタデータ) (2021-11-23T03:07:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。