論文の概要: Unifying Video Tasks via Spatiotemporal Analogy
- arxiv url: http://arxiv.org/abs/2609.33935v2
- Date: Wed, 30 Sep 2026 23:45:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.454607
- Title: Unifying Video Tasks via Spatiotemporal Analogy
- Title(参考訳): 時空間アナロジーによる映像タスクの統一
- Abstract要約: ビデオキャンバスの学習を通じて視覚領域から映像領域まで拡張するフレームワークであるVi-Geoを紹介した。
類推に基づく手法が多様なビデオタスクを統一し、アウト・オブ・ディストリビューションシナリオに一般化できるかどうかを評価する。
タスク内部化では、事前訓練されたタスクに関連付けられたクエリフォーマットがデモをオーバーライドする。
- 参考スコア(独自算出の注目度): 35.29539684571019
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adapting video models to new tasks typically requires dedicated data curation and fine-tuning. While visual analogy provides a training-free alternative by specifying tasks in-context, it remains restricted to the image domain. To explore whether analogy-based methods can unify diverse video tasks and generalize to out-of-distribution scenarios, we introduce ViGeo, a framework that extends visual in-context learning to the video domain via spatiotemporal canvas completion. Evaluated on a diverse task taxonomy with a strict train-test split, ViGeo generalizes to unseen video manipulations and zero-shot modalities (e.g., event cameras). Finally, we identify task internalization, where a query format associated with a pretrained task overrides the demonstration, and show that this shortcut can be removed with a small amount of task-unrelated data, highlighting the need to decorrelate prompt format from task identity.
- Abstract(参考訳): ビデオモデルを新しいタスクに適用するには、通常、専用のデータキュレーションと微調整が必要である。
ビジュアルアナロジーは、コンテキスト内でタスクを指定することで、トレーニング不要の代替手段を提供するが、依然としてイメージドメインに限定されている。
アナログベースの手法が多様なビデオタスクを統一し、配布外シナリオに一般化するかどうかを検討するため、時空間キャンバスの補完を通じて視覚的インコンテキスト学習をビデオ領域に拡張するフレームワークViGeoを紹介した。
ViGeoは、厳格な列車テストの分割を伴う多様なタスク分類に基づいて評価され、目に見えないビデオ操作とゼロショットモード(イベントカメラなど)に一般化されている。
最後に、事前訓練されたタスクに関連するクエリフォーマットがデモをオーバーライドするタスク内部化を特定し、このショートカットを少数のタスク非関連データで除去できることを示し、タスク識別からプロンプトフォーマットをデコレーションする必要性を強調した。
関連論文リスト
- Training-Free Temporal Abstraction for General Video Understanding [12.051446549851844]
映像を意味的に意味のある時間的チャンクに分割する訓練不要なSTITCHを提案する。
我々は,汎用イベント境界検出,言語に基づくモーメント検索,長ビデオVLM推論のためのフレーム選択についてSTITCHを評価する。
論文 参考訳(メタデータ) (2026-08-28T05:10:54Z) - Unified Video Dense Prediction from Disjoint Data [71.9957801898161]
深度,表面正規度,セマンティックセグメンテーション,境界,人的部分,アルベド,シェーディング,素材の8つの密集したシーン特性を共同で予測する統合ビデオモデルUniDを紹介する。
本稿では,タスクプロジェクタを介し,タスク毎の専門家が統一されたバックボーンを監督する簡易かつ効果的な蒸留手順を提案する。
UniDは、タスクごとのスペシャリストやマルチタスクベースラインと競合するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-07-23T17:59:50Z) - TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding [83.96715649130435]
VTGタスクを効果的に分解するMixture-of-Experts(MoE)ベースのVideo-LLMであるTimeExpertを紹介する。
我々の設計選択は各サブタスクの正確な処理を可能にし、様々なVTGアプリケーション間でのイベントモデリングの改善につながります。
論文 参考訳(メタデータ) (2025-08-03T10:03:58Z) - UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization [83.89550658314741]
ビデオローカライゼーションタスクは、時間的アクションローカライゼーション(TAL)、サウンドイベント検出(SED)、オーディオ視覚イベントローカライゼーション(AVEL)など、ビデオ内の特定のインスタンスを時間的に特定することを目的としている。
本報告では, tal, SED, AVELタスクの協調学習を初めて行うために, 統合音声認識ネットワークUniAVを提案する。
論文 参考訳(メタデータ) (2024-04-04T03:28:57Z) - Dense Video Object Captioning from Disjoint Supervision [77.47084982558101]
本稿では,高密度ビデオオブジェクトキャプションのための新しいタスクとモデルを提案する。
このタスクは、ビデオにおける空間的および時間的局所化を統一する。
我々は、この新しいタスクの強力なベースラインにおいて、我々のモデルがどのように改善されているかを示す。
論文 参考訳(メタデータ) (2023-06-20T17:57:23Z) - MINOTAUR: Multi-task Video Grounding From Multimodal Queries [70.08973664126873]
長文ビデオにおける問合せに基づくビデオ理解に一貫した単一のモデルを提案する。
特に、我々のモデルは、Ego4D Episodic Memoryベンチマークの3つのタスクすべてに対処できる。
論文 参考訳(メタデータ) (2023-02-16T04:00:03Z) - Joint Visual-Temporal Embedding for Unsupervised Learning of Actions in
Untrimmed Sequences [25.299599341774204]
本稿では,共同視覚-時間埋め込み空間に基づく映像系列の教師なし学習手法を提案する。
提案手法は、連続したビデオフレームに存在する視覚的手がかりから有意義な視覚的、時間的埋め込みを提供することができることを示す。
論文 参考訳(メタデータ) (2020-01-29T22:51:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。