論文の概要: Learning to Reason with Persistent Object States for Video Instance Segmentation
- arxiv url: http://arxiv.org/abs/2609.35539v1
- Date: Mon, 28 Sep 2026 16:19:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 21:01:20.110543
- Title: Learning to Reason with Persistent Object States for Video Instance Segmentation
- Title(参考訳): ビデオインスタンスセグメンテーションのための永続オブジェクト状態の推論学習
- Abstract要約: ビデオセグメンテーションモデルは、フレーム全体にインスタンス情報を運ぶことによって、オブジェクトのアイデンティティを保持する。
我々はPOSReasonerを紹介します。これはトレーニング可能なプラグイン・アンド・プレイフレームワークで、オブザーバがオブジェクトの状態を変えるべきタイミングを明確に決定します。
長期VOSとVISベンチマークによる実験では、強いベースラインよりも一貫した改善が見られた。
- 参考スコア(独自算出の注目度): 6.1925700989107995
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video segmentation models maintain object identities by carrying instance information across frames. Under prolonged occlusion, reappearance, or interactions between similar instances, however, an unreliable update can overwrite a valid history and cause persistent identity drift. We introduce POSReasoner, a trainable, plug-and-play framework that explicitly decides when an observation should change an object's state. Each persistent state records identity, confidence, and absence history. A sparse state-observation graph supports Propose-Verify reasoning: provisional associations are revisited using object history, predicted presence, and competition among identities. The verified decisions determine whether to retain, update, reactivate, or suppress each state, while a learned gate controls the evidence written back to memory. Only verified transitions update the persistent state used in subsequent frames. POSReasoner uses standard video annotations and keeps the base model frozen, enabling integration with diverse VOS and VIS architectures. Experiments across long-term VOS and VIS benchmarks show consistent improvements over strong baselines, with the largest gains under occlusion and object reappearance.
- Abstract(参考訳): ビデオセグメンテーションモデルは、フレーム全体にインスタンス情報を運ぶことによって、オブジェクトのアイデンティティを保持する。
しかし、長いオクルージョン、再出現、または同様のインスタンス間の相互作用の下で、信頼性の低い更新は有効な履歴を上書きし、永続的なアイデンティティドリフトを引き起こす。
我々はPOSReasonerを紹介します。これはトレーニング可能なプラグイン・アンド・プレイフレームワークで、オブザーバがオブジェクトの状態を変えるべきタイミングを明確に決定します。
それぞれの永続状態は、アイデンティティ、信頼、および欠席履歴を記録する。
スパース状態観測グラフは、Propose-Verify推論(Propose-Verify reasoning): 一時的な関連は、オブジェクト履歴、予測存在、アイデンティティ間の競合によって再考される。
決定された決定は、各状態の保持、更新、再活性化、または抑制を決定する一方、学習ゲートはメモリに書き戻された証拠を制御する。
検証された遷移のみが、後のフレームで使用される永続状態を更新する。
POSReasonerは標準のビデオアノテーションを使用してベースモデルを凍結し、多様なVOSとVISアーキテクチャとの統合を可能にする。
長期のVOSとVISベンチマークによる実験では、強いベースラインよりも一貫した改善が見られ、最大のゲインはオクルージョンとオブジェクトの再出現である。
関連論文リスト
- StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos [45.587387649513325]
StateTraceは、トラジェクトリ、オブジェクト間関係、状態遷移イベントを構造化された推論基板にまとめる再利用可能な時間状態メモリを構築する。
StateTraceは、パブリックベンチマークとHSR-Benchの両方のパフォーマンスを継続的に改善することを示す。
論文 参考訳(メタデータ) (2026-08-19T04:31:56Z) - Dual-State Slot Attention: Decoupling Appearance and Identity for Video Object-Centric Learning [17.16289725621027]
教師なしのビデオオブジェクト中心学習は、動的シーンを監督なしで永続的なオブジェクトレベル表現に分解することを目的としている。
既存のスロットベースの手法は、高速動作や部分閉塞といった挑戦的な設定において、安定したオブジェクトのアイデンティティを維持するのに苦労する。
本稿では,自己管理型フレームワークであるDual-State Slot Attention (DSSA)を提案する。
論文 参考訳(メタデータ) (2026-06-10T19:00:47Z) - TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models [9.648992690108086]
ビデオ大言語モデル(ビデオ-LLM)は、一般的なビデオ理解において大きな進歩を遂げているが、時間的オブジェクトの一貫性を維持する能力はいまだ探索されていない。
ビデオLLMにおける時間的オブジェクトの一貫性を評価するための診断ベンチマークであるTOC-Benchを紹介する。
論文 参考訳(メタデータ) (2026-05-11T02:47:59Z) - Latest Object Memory Management for Temporally Consistent Video Instance Segmentation [17.805350735895114]
時間的に一貫したビデオインスタンスセグメンテーションのための最新のオブジェクトメモリ管理(LOMM)を提案する。
LOMMは、各フレームにおけるオブジェクトの存在を明示的にモデル化することで、オブジェクトの最新の状態を堅牢に追跡し、更新する。
Decoupled Object Association (DOA)は、新しく出現し、すでに存在するオブジェクトを別々に扱う戦略である。
論文 参考訳(メタデータ) (2025-07-26T02:52:41Z) - DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries [60.09774333024783]
動的アンカークエリ(DAQ)を導入し、アンカーとターゲットクエリ間の遷移ギャップを短くする。
また,クエリレベルのオブジェクトEmergence and Disappearance Simulation(EDS)戦略を導入する。
実験により、DVIS-DAQは5つの主流ビデオセグメンテーションベンチマーク上で、新しい最先端(SOTA)性能を達成することが示された。
論文 参考訳(メタデータ) (2024-03-29T17:58:50Z) - Learning to Track with Object Permanence [61.36492084090744]
共同物体の検出と追跡のためのエンドツーエンドのトレーニング可能なアプローチを紹介します。
私たちのモデルは、合成データと実データで共同トレーニングされ、KITTIおよびMOT17データセットの最先端を上回ります。
論文 参考訳(メタデータ) (2021-03-26T04:43:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。