論文の概要: ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation
- arxiv url: http://arxiv.org/abs/2607.24098v1
- Date: Mon, 27 Jul 2026 07:39:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.347561
- Title: ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation
- Title(参考訳): ReflexTrack: トレーニング不要なビデオオブジェクトセグメンテーションのためのフィードバック駆動エージェント
- Authors: Yuanjia Li, Tianyang Xu, Tao Zhou, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler,
- Abstract要約: オブジェクトセグメンテーション(RVOS)を参照するには、ビデオを通して自然言語で指定されたターゲットをセグメンテーションする必要がある。
近年のエージェントアプローチでは,タスク固有のトレーニングなしでRVOSを実行するために,マルチモーダルな大規模言語モデルと迅速なセグメンテーションモデルを組み合わせている。
トレーニング不要でフィードバック駆動型エージェントであるReflexTrackを導入し、空間的および時間的両方のレベルでループを閉じる。
- 参考スコア(独自算出の注目度): 63.38679125666075
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Referring video object segmentation (RVOS) requires segmenting a target specified by natural language throughout a video. Recent agentic approaches combine multimodal large language models with promptable segmentation models to perform RVOS without task-specific training. However, most pipelines rely on one-shot spatial grounding followed by mask propagation, leaving both the initial prompts and temporal predictions largely unverified. We introduce ReflexTrack, a training-free, feedback-driven agent that closes this loop at both spatial and temporal levels. Mask-guided Spatial Refinement evaluates the mask induced by the current keyframe prompt and iteratively updates the bounding box together with positive and negative points, yielding a more reliable initialization. Video-level Mask Reflection assesses the complete mask sequence, localizes unreliable intervals, selects complementary repair keyframes, and generates candidate predictions through mask-guided re-propagation. Only candidates that provide a verified improvement are used to update the affected intervals, preserving reliable predictions elsewhere. All components remain frozen during inference. ReflexTrack achieves an overall $\mathcal{Q}$ score of $69.7$ on Ref-VPS and a $\mathcal{J}\&\mathcal{F}$ score of $67.2$ on ReasonVOS. These results demonstrate that prediction-level feedback substantially improves the reliability of training-free RVOS.
- Abstract(参考訳): ビデオオブジェクトのセグメンテーション(RVOS)を参照するには、ビデオ全体を通して自然言語で指定されたターゲットをセグメンテーションする必要がある。
近年のエージェント的アプローチでは,タスク固有のトレーニングなしでRVOSを実行するために,マルチモーダルな大規模言語モデルと迅速なセグメンテーションモデルを組み合わせている。
しかし、ほとんどのパイプラインは1ショットの空間的接地に依存しており、その後マスクの伝播が続き、最初のプロンプトと時間的予測の両方がほとんど検証されていない。
トレーニング不要でフィードバック駆動型エージェントであるReflexTrackを導入し、このループを空間的および時間的両方のレベルで閉じる。
Mask-guided Space Refinementは、現在のキーフレームプロンプトによって誘導されるマスクを評価し、バウンディングボックスを正および負の点とともに反復的に更新し、より信頼性の高い初期化をもたらす。
ビデオレベルMask Reflectionは、完全なマスクシーケンスを評価し、信頼できない間隔をローカライズし、補修キーフレームを選択し、マスク誘導再プロパゲーションにより候補予測を生成する。
検証された改善を提供する候補のみが、影響のある間隔を更新し、他の場所で信頼性のある予測を保持するために使用される。
すべてのコンポーネントは推論中に凍結される。
ReflexTrackは、全体的な$\mathcal{Q}$スコアをRef-VPSで69.7ドル、$\mathcal{J}\&\mathcal{F}$スコアをReasonVOSで67.2ドルを達成する。
これらの結果から,予測レベルのフィードバックはトレーニング不要RVOSの信頼性を大幅に向上することが示された。
関連論文リスト
- Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging [62.24239343184817]
マルチモーダル適応は、知覚能力を持つ大きな言語モデルに装備するが、言語のみの事前学習から受け継いだ推論能力を弱めることが多い。
ビデオ言語モデルにおける時間的推論を復元するための訓練不要なタスク駆動モデルマージフレームワークであるMERITを提案する。
論文 参考訳(メタデータ) (2026-04-13T12:41:50Z) - Temporal Prompting Matters: Rethinking Referring Video Object Segmentation [64.82333675385802]
Referring Video Object (RVOS) は、クエリ文によって参照されるオブジェクトをビデオにセグメントすることを目的としている。
既存のほとんどの方法は、密集したマスクアノテーションによるエンドツーエンドのトレーニングを必要とする。
本稿では,参照要因とビデオ要因に対処するテンポラル・プロンプト生成・選択(テネ)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-08T17:59:57Z) - ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations [33.74746234704817]
ビデオオブジェクトセグメンテーション(RVOS)は、テキスト記述に基づいて、ビデオ全体を通してターゲットオブジェクトをセグメンテーションすることを目的としている。
これは、深い視覚レベルの理解、ピクセルレベルの高密度な予測、時間的推論を含むため、難しい。
基礎的な視覚基盤モデルから領域レベルの視覚テキストアライメントを継承するbfReferDINO RVOSを提案する。
論文 参考訳(メタデータ) (2025-01-24T16:24:15Z) - Bridge the Points: Graph-based Few-shot Segment Anything Semantically [79.1519244940518]
プレトレーニング技術の最近の進歩により、視覚基礎モデルの能力が向上した。
最近の研究はSAMをFew-shot Semantic segmentation (FSS)に拡張している。
本稿では,グラフ解析に基づく簡易かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-10-09T15:02:28Z) - Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation [42.020470627552136]
オープン語彙のセグメンテーションは、主にマスク生成ではなく、マスク分類によってボトルネックとなる。
本稿では,この制限に対処するためのFISA法を提案する。
FISAは、視覚符号化プロセスの初期に、この重要な意味情報を明示的に統合することにより、抽出した視覚的特徴をきめ細かな意味認識で強化する。
論文 参考訳(メタデータ) (2024-09-24T17:50:28Z) - Improving Adversarial Robustness of Masked Autoencoders via Test-time
Frequency-domain Prompting [133.55037976429088]
BERTプリトレーニング(BEiT, MAE)を備えた視覚変換器の対向ロバスト性について検討する。
意外な観察は、MAEが他のBERT事前訓練法よりも敵の頑健さが著しく悪いことである。
我々は,MAEの対角的堅牢性を高めるための,シンプルで効果的な方法を提案する。
論文 参考訳(メタデータ) (2023-08-20T16:27:17Z) - Make One-Shot Video Object Segmentation Efficient Again [7.7415390727490445]
ビデオオブジェクトセグメンテーション(VOS)は、ビデオの各フレームにオブジェクトの集合をセグメンテーションするタスクを記述する。
e-OSVOSはオブジェクト検出タスクを分離し、Mask R-CNNの修正版を適用してローカルセグメンテーションマスクのみを予測する。
e-OSVOSは、DAVIS 2016、DAVIS 2017、YouTube-VOSの1ショットの微調整方法に関する最先端の結果を提供する。
論文 参考訳(メタデータ) (2020-12-03T12:21:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。