論文の概要: Mind the Gap: Disentangling Performance Bottlenecks in Video Instance Segmentation
- arxiv url: http://arxiv.org/abs/2606.07394v1
- Date: Fri, 05 Jun 2026 15:32:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-08 14:33:29.829357
- Title: Mind the Gap: Disentangling Performance Bottlenecks in Video Instance Segmentation
- Title(参考訳): Mind the Gap: ビデオインスタンスセグメンテーションにおけるパフォーマンスのボトルネックを解消する
- Abstract要約: ビデオインスタンス(VIS)分類、セグメンテーション、追跡目的を共同で評価する。
アルゴリズム線形プログラム(ILP)としてのアイデンティティとクラス割り当てを定式化する診断フレームワークを導入する。
TrackLensも導入しています。これはスケールを観測可能なクエリレベルの障害モードに変換するビジュアルツールです。
- 参考スコア(独自算出の注目度): 0.34410212782758043
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In Video Instance Segmentation (VIS), classification, segmentation, and tracking objectives are jointly evaluated, but their individual contributions to performance loss remain opaque. We introduce a diagnostic framework that formulates identity and class assignment as an Integer Linear Program (ILP), yielding a model-agnostic oracle that hierarchically isolates each error source. Applied to seven VIS methods spanning online and offline paradigms across YouTube-VIS 2019/2021 and a diagnostic subset of OVIS, our analysis reveals a consistent picture. Tracking instability is a critical bottleneck for online methods, with gaps exceeding 20 AP under heavy occlusion, and grows sharply with video length and instance density. While semantic classification contributes meaningfully on standard benchmarks, its impact becomes negligible where tracking fails most. Although stronger backbones substantially lift default scores, they leave AP tracking gaps largely intact, confirming that temporal fragility is algorithmic rather than purely representational. To complement the oracle, we introduce TrackLens, a visual tool that translates gap magnitude into observable, query-level failure modes. Together, these tools provide a systematic foundation for targeting VIS's core challenge: robust long-term temporal association.
- Abstract(参考訳): ビデオインスタンスセグメンテーション(VIS)では、分類、セグメンテーション、トラッキングの目的が共同で評価されるが、パフォーマンス損失に対する個々の貢献は不透明である。
Integer Linear Program (ILP) としてアイデンティティとクラス割り当てを定式化する診断フレームワークを導入し,各エラーソースを階層的に分離するモデルに依存しないオラクルを生成する。
YouTube-VIS 2019/2021のオンラインパラダイムとオフラインパラダイムにまたがる7つのVISメソッドと、OVISの診断サブセットに適用すると、一貫した画像が明らかになる。
追跡不安定性はオンライン手法にとって重要なボトルネックであり、ビデオの長さとインスタンス密度によってギャップは20APを超えている。
セマンティック分類は標準ベンチマークに有意義に寄与するが、その影響は追跡が最も失敗する場所で無視される。
強いバックボーンはデフォルトスコアを大幅に引き上げるが、AP追跡ギャップは大部分が無傷であり、時間的不安定性は純粋に表現的ではなくアルゴリズム的であることを確認した。
オラクルを補完するために、ギャップの規模を観測可能なクエリレベルの障害モードに変換するビジュアルツールであるTrackLensを紹介します。
これらのツールが組み合わさって、VISの中核的課題である堅牢な長期的関連をターゲットとする体系的な基盤を提供する。
関連論文リスト
- Open-World Video Segmentation [21.65294890698273]
本稿では,オープンワールドビデオセグメンテーションのための実用的で強力なシステムであるSavvyを紹介する。
Savvyは、永続的なオブジェクト発見、安全なトラックプロモーション、安定した長距離アイデンティティメンテナンスをサポートする。
また,オープンワールドビデオセグメンテーションのための粒度認識評価スイートであるOGAを提案する。
論文 参考訳(メタデータ) (2026-06-14T06:48:15Z) - Causal Bootstrapped Alignment for Unsupervised Video-Based Visible-Infrared Person Re-Identification [52.784239635604735]
VVI-ReIDは、静止画像以外にも時間情報が付加的な手がかりを提供する、全日監視のための重要な技術である。
既存のアプローチは、高価なクロスモダリティアノテーションによる完全な教師付き学習に大きく依存しており、スケーラビリティが制限されています。
そこで,本研究では,ビデオの先行を明示的に活用するCausal Bootstrapped Alignmentフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-17T02:15:59Z) - From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Tracking [24.903851740154433]
本稿では,3つの視点にまたがってオブジェクトの識別性を高める明示的な特徴フレームワークを提案する。
実験によると、SpngeBobAはDanceTrack、SportsMOT、BFTなど、複数の挑戦的なMOTベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-02T04:04:39Z) - Improving Weakly-supervised Video Instance Segmentation by Leveraging Spatio-temporal Consistency [9.115508086522887]
我々はEigen VISと呼ばれる弱い教師付き手法を導入し、他のVIS手法と比較して競争精度を向上する。
この方法は、時間固有値損失(TEL)とクリップレベルの品質コ効率(QCC)の2つの重要なイノベーションに基づいている。
コードはhttps://github.com/farnooshar/EigenVIS.comで公開されている。
論文 参考訳(メタデータ) (2024-08-29T16:05:05Z) - DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries [60.09774333024783]
動的アンカークエリ(DAQ)を導入し、アンカーとターゲットクエリ間の遷移ギャップを短くする。
また,クエリレベルのオブジェクトEmergence and Disappearance Simulation(EDS)戦略を導入する。
実験により、DVIS-DAQは5つの主流ビデオセグメンテーションベンチマーク上で、新しい最先端(SOTA)性能を達成することが示された。
論文 参考訳(メタデータ) (2024-03-29T17:58:50Z) - VISAGE: Video Instance Segmentation with Appearance-Guided Enhancement [39.154059294954614]
オンラインビデオインスタンス (VIS) 法は、強力なクエリベースの検出器によって著しく進歩している。
しかし,これらの手法は位置情報に大きく依存していることが観察された。
本稿では,トラッカーにおける物体マッチングの鍵軸は外観情報であり,位置的手がかりが不十分な状況下では,その特徴を識別する上で非常に指導的になることを示す。
論文 参考訳(メタデータ) (2023-12-08T07:48:03Z) - Scalable Incomplete Multi-View Clustering with Structure Alignment [71.62781659121092]
本稿では,新しいアンカーグラフ学習フレームワークを提案する。
ビュー固有のアンカーグラフを構築し、異なるビューから補完情報をキャプチャする。
提案したSIMVC-SAの時間と空間の複雑さはサンプル数と線形に相関していることが証明された。
論文 参考訳(メタデータ) (2023-08-31T08:30:26Z) - CTVIS: Consistent Training for Online Video Instance Segmentation [62.957370691452844]
オンラインビデオインスタンスセグメンテーション(VIS)におけるインスタンスの関連付けにおいて,インスタンス埋め込みの識別が重要な役割を担っている
近年のオンラインVIS手法では,参照フレームのみから派生したCIを活用している。
我々は,オンラインVIS(Consistent Training for Online VIS)と呼ばれる,トレーニングパイプラインと推論パイプラインの整合性を重視した,シンプルで効果的なトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2023-07-24T08:44:25Z) - DVIS: Decoupled Video Instance Segmentation Framework [15.571072365208872]
ビデオインスタンスセグメンテーション(VIS)は、自律運転やビデオ編集を含む様々なアプリケーションにおいて重要なタスクである。
既存の手法は、主に2つの要因により、実世界の複雑なビデオや長いビデオでは性能が劣ることが多い。
分割,追跡,改良の3つの独立したサブタスクに分割することで,VISの分離戦略を提案する。
論文 参考訳(メタデータ) (2023-06-06T05:24:15Z) - Occluded Video Instance Segmentation: Dataset and ICCV 2021 Challenge [133.80567761430584]
我々はOVISと呼ばれる大規模データセットを収集し、隠されたシナリオでビデオインスタンスのセグメンテーションを行う。
OVISは296kの高品質のインスタンスマスクと901の隠蔽シーンで構成されている。
全てのベースライン法は、強吸収対象群で約80%の性能低下に遭遇する。
論文 参考訳(メタデータ) (2021-11-15T17:59:03Z) - Self-supervised Video Object Segmentation [76.83567326586162]
本研究の目的は、半教師付きビデオオブジェクトセグメンテーション(高密度トラッキング)の解決を目的とした自己教師付き表現学習である。
i) 従来の自己教師型アプローチを改善すること、(ii) オンライン適応モジュールによる自己教師型アプローチの強化により、空間的時間的不連続性によるトラッカーのドリフトを緩和すること、(iv) DAVIS-2017とYouTubeの自己教師型アプローチで最先端の結果を示すこと、などが提案されている。
論文 参考訳(メタデータ) (2020-06-22T17:55:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。