論文の概要: Towards Automatic Video Annotation with ASH: Zero-Shot Open-Vocabulary Multi-Object Tracking and Segmentation
- arxiv url: http://arxiv.org/abs/2610.01022v1
- Date: Thu, 01 Oct 2026 04:09:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.889374
- Title: Towards Automatic Video Annotation with ASH: Zero-Shot Open-Vocabulary Multi-Object Tracking and Segmentation
- Title(参考訳): ASHによる自動ビデオアノテーションの実現に向けて: ゼロショットオープンボキャブラリ多目的追跡とセグメンテーション
- Abstract要約: 本研究は、任意のビデオの完全自動トラッキングに対する2つの貢献を紹介する。
Generalized Presence Token (GPT)はSAM3の推論パイプラインを再構成し、Nテキストプロンプトを同時に処理する。
ASHパイプラインは任意のメモリアテンションVISトラッカーを任意の長さのシーケンスに拡張する。
- 参考スコア(独自算出の注目度): 14.921064309495092
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Memory-attention-based Video Instance Segmentation (VIS) methods have demonstrated strong zero-shot tracking capability, yet their substantial memory requirements confine them to short video clips and their single-prompt inference design makes multi-category open-vocabulary tracking computationally prohibitive. This work introduces two contributions toward fully automated tracking annotation of arbitrary video. The Generalized Presence Token (GPT) reformulates SAM3's inference pipeline to process N text prompts simultaneously via virtual prompt batching, reducing image encoding cost from O(N) to O(1) with no modifications to any learned component. The Annotation and Segmentation Handler (ASH) extends any memory-attention VIS tracker to sequences of arbitrary length through overlapping temporal chunks with IoU-based inter-chunk identity matching, requiring no dataset-specific training. Instantiated on SAM3, the resulting pipeline -- SAM3-ASH -- achieves state-of-the-art HOTA on MOTS20 under fully zero-shot conditions and remains competitive with trained specialists across seven additional benchmarks, while peak GPU memory consumption stays below 25 GB, establishing a practical baseline for scalable, training-free automated video annotation.
- Abstract(参考訳): メモリアテンションに基づくビデオインスタンスセグメンテーション(VIS)手法は、強力なゼロショットトラッキング能力を示しているが、そのメモリ要求は短いビデオクリップに制限されており、シングルプロンプト推論設計は、マルチカテゴリのオープン語彙追跡を計算的に禁止している。
本研究は、任意のビデオの完全自動トラッキングアノテーションに対する2つの貢献を紹介する。
Generalized Presence Token (GPT)はSAM3の推論パイプラインを再構成し、仮想的なプロンプトバッチ処理によってNテキストプロンプトを同時に処理し、学習コンポーネントの変更なしに画像符号化コストをO(N)からO(1)に削減する。
Annotation and Segmentation Handler (ASH)は、任意のメモリアテンションVISトラッカーを、IoUベースのチャンク間IDマッチングと重複する時間チャンクを通じて任意の長さのシーケンスに拡張し、データセット固有のトレーニングを必要としない。
SAM3で実証された結果のパイプラインであるSAM3-ASHは、完全にゼロショット条件下でMOTS20上で最先端のHOTAを実現し、7つのベンチマークでトレーニングされたスペシャリストと競合する一方で、ピーク時のGPUメモリ消費は25GB未満であり、スケーラブルでトレーニング不要な自動ビデオアノテーションの実用的なベースラインを確立している。
関連論文リスト
- OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains [50.186434778589415]
音声-視覚的質問回答(QA)のための現在の自動パイプラインは、一般的にビデオキャプション-QA'のパラダイムを採用している。
textbfEntity-Anchored Video Scripting' と textbfClue-Guided QA Generation' という2つのメカニズムを備えた自動データエンジンを提案する。
論文 参考訳(メタデータ) (2026-06-12T17:59:55Z) - Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory [79.01059178883817]
IAMFlowはトレーニング不要のID対応メモリフレームワークで、永続的なエンティティのIDを明示的にモデル化し追跡する。
VLMは、レンダリングフレームから属性を非同期に検証し、洗練し、暗黙の類似性ベースのマッチングの代わりに明示的なエンティティ追跡を可能にする。
NarraStream-Benchは,6次元にまたがる324のマルチプロンプトスクリプトを備えた,ナラストリームビデオ生成のためのベンチマークである。
論文 参考訳(メタデータ) (2026-05-18T17:54:34Z) - Fast SAM2 with Text-Driven Token Pruning [52.8350457627401]
Segment Anything Model 2 (SAM2) では、視覚計算モデルがプロンプト駆動のビデオオブジェクトセグメンテーションにおいて大幅に進歩している。
SAM2パイプラインは、イメージエンコーダが生成するすべての視覚トークンを、ターゲットオブジェクトとの関係にかかわらず、下流の時間的推論モジュールを通じて伝達する。
本稿では,時間的伝播に先立ってトークン密度を選択的に低減し,推論効率を向上させるためのテキスト誘導型トークンプルーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-24T18:59:05Z) - Autoregressive Universal Video Segmentation Model [76.53497940205294]
Autoregressive Universal Model (AUSM) は、プロンプトとアンプロンプトの両方を統一する単一のアーキテクチャである。
AUSMは、以前のユニバーサルストリーミングビデオセグメンテーション法より優れ、16フレームシーケンスでのトレーニングを最大2.5倍高速化する。
論文 参考訳(メタデータ) (2025-08-26T17:59:13Z) - SAM2Auto: Auto Annotation Using FLASH [13.638155035372835]
VLM(Vision-Language Models)は、注釈付きデータセットの不足により、大規模言語モデルに遅れている。
SAM2Autoは、人間の介入やデータセット固有のトレーニングを必要としないビデオデータセットのための、最初の完全に自動化されたアノテーションパイプラインである。
本システムでは, 検出誤差を最小限に抑えつつ, ビデオシーケンス全体にわたって一貫した物体追跡を確実にするため, 統計的手法を用いている。
論文 参考訳(メタデータ) (2025-06-09T15:15:15Z) - VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers [23.541896057977745]
VideoScanは、リアルタイムビデオインタラクションのための効率的な視覚言語モデル(VLM)推論フレームワークである。
VideoScanでは、各フレームを表すために単一のセマンティックキャリアトークンを使用している。
論文 参考訳(メタデータ) (2025-03-12T13:30:40Z) - UVIS: Unsupervised Video Instance Segmentation [65.46196594721545]
ビデオキャプションインスタンスのセグメンテーションには、ビデオフレームをまたいだすべてのオブジェクトの分類、セグメンテーション、追跡が必要である。
UVISは,ビデオアノテーションや高密度ラベルに基づく事前学習を必要とせずに,ビデオインスタンスのセグメンテーションを行うことのできる,新しいUnsupervised Video Instance (UVIS) フレームワークである。
本フレームワークは,フレームレベルの擬似ラベル生成,トランスフォーマーベースのVISモデルトレーニング,クエリベースのトラッキングという3つの重要なステップで構成されている。
論文 参考訳(メタデータ) (2024-06-11T03:05:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。