論文の概要: Forget, Anticipate and Adapt: Test Time Training for Long Videos
- arxiv url: http://arxiv.org/abs/2606.26515v2
- Date: Sat, 27 Jun 2026 01:18:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 13:45:02.08285
- Title: Forget, Anticipate and Adapt: Test Time Training for Long Videos
- Title(参考訳): Forget, Precipate, Adapt:ロングビデオのためのテストタイムトレーニング
- Abstract要約: テストタイムトレーニング(TTT、Test Time Training)は、モデルが自己教師付き(SSL)タスクを実行し、推論中に重みを更新することで、入ってくるテストサンプルに適応するメカニズムである。
本稿では,長編ビデオのTTTに着目した。
1) 従来のフレームを含むスライディングウィンドウを用いてTTT更新を行い、その計算量はウィンドウのサイズとともに線形に増加する。
1)スライディングウィンドウ内の3つのフレーム、すなわち、出口するフレーム、現在のフレーム、そしてそれに続くフレームのみで動作するフレームフォッティングネットワーク(FFN)を提示する。
- 参考スコア(独自算出の注目度): 11.887563148951132
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test Time Training (TTT) is a mechanism in which a model adapts to an incoming test-sample by performing some self-supervised (SSL) task and updating its weights even during inference. This procedure does not require labels at test-time. This paper focuses on TTT for long-videos. A major concern with existing approaches is: 1) they perform TTT updates using a sliding window containing frames in the past, whose compute increases linearly with the size of window. This becomes computationally intractable when the videos are hours long. 2) TTT is performed even when temporally close frames look similar, thereby consuming a lot of compute. We present the Frame Forgetting Network (FFN) that: 1) operates on only three frames within the sliding window, namely the frame that exits, the current frame and the frame after that. The model still manages to retain temporal context and work for hours long-videos; 2) mathematically define a surprise metric: how much new information the incoming frame contains with respect to the past seen frame. This facilitates determining how to modify the effective window size during TTT and constitutes the core mechanism of an adaptive windowing algorithm. Additionally, we curate a dataset EpicTours containing up to 3 hour long videos of walking city-tours, whereas earlier datasets on this problem were only 5 min long. We demonstrate FFNs empirical effectiveness on dense-segmentation, video classification tasks, generalization to depth-estimation, and multi-hour long videos.
- Abstract(参考訳): テストタイムトレーニング(TTT、Test Time Training)は、モデルが自己教師付き(SSL)タスクを実行し、推論中に重みを更新することで、入ってくるテストサンプルに適応するメカニズムである。
この手順はテスト時にラベルを必要としない。
本稿では,長編ビデオのTTTに着目した。
既存のアプローチに対する大きな懸念は次のとおりである。
1)過去のフレームを含むスライディングウィンドウを用いてTTT更新を行い,その計算量はウィンドウサイズとともに線形に増加する。
ビデオの長さが数時間になると、計算が難しくなります。
2) TTT は時間的に閉じたフレームが似ていても実行され,計算量が多い。
本稿では Frame Forgetting Network (FFN) について述べる。
1)スライディングウィンドウ内の3つのフレーム、すなわち出口となるフレーム、現在のフレーム、それから続くフレームでのみ動作する。
モデルは、時間的コンテキストを維持し、何時間もビデオを処理します。
2) サプライズメトリックを数学的に定義する: 受信フレームが過去のフレームに対してどれだけ新しい情報を含んでいるか。
これにより、TTT中の有効ウィンドウサイズの変更の仕方の決定が容易となり、適応ウィンドウアルゴリズムのコアメカニズムを構成する。
EpicToursには最大3時間のウォーキングシティツアービデオが含まれており、この問題に関する以前のデータセットはわずか5分だった。
FFNが高密度セグメンテーション, 映像分類タスク, 深度推定への一般化, 複数時間長ビデオに有効であることを示す。
関連論文リスト
- VidCtx: Context-aware Video Question Answering with Image Models [15.1350316858766]
VidCtxは、入力フレームからの視覚情報と他のフレームのテキスト記述の両方を統合する、新しいトレーニング不要なビデオQAフレームワークである。
実験により、VidCtxはオープンモデルに依存するアプローチ間の競争性能を達成することが示された。
論文 参考訳(メタデータ) (2024-12-23T09:26:38Z) - Test-Time Training on Video Streams [66.63237260332984]
以前の作業では、テスト時にトレーニングされたモデルをさらに改善するための一般的なフレームワークとして、テスト時間トレーニング(TTT)が確立されていた。
TTTをストリーミング設定に拡張し、複数のテストインスタンスが時間順に到着します。
オンラインTTTは、現実世界の3つのデータセット上で、4つのタスクで固定モデルベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2023-07-11T05:17:42Z) - Towards Frame Rate Agnostic Multi-Object Tracking [76.82407173177138]
本稿では,FraMOT 問題に初めて取り組むために,FAPS を用いたフレームレート非依存MOT フレームワークを提案する。
具体的には,フレームレート情報を推論し,符号化するフレームレートアグノスティックアソシエーションモジュール(FAAM)を提案する。
FAPSは、パターンマッチングと融合を追跡することによって、トレーニングにおけるすべての後処理ステップを反映する。
論文 参考訳(メタデータ) (2022-09-23T04:25:19Z) - Real-time Online Video Detection with Temporal Smoothing Transformers [4.545986838009774]
優れたストリーミング認識モデルは、ビデオの長期的ダイナミクスと短期的変化の両方をキャプチャする。
この問題に対処するため、カーネルのレンズを通してビデオトランスのクロスアテンションを再構成する。
テンポラルスムース変換器であるTeSTraを構築し、キャッシュと計算オーバーヘッドを一定に保ちながら任意の長さの入力を行う。
論文 参考訳(メタデータ) (2022-09-19T17:59:02Z) - Revealing Single Frame Bias for Video-and-Language Learning [115.01000652123882]
単一フレームのトレーニングモデルでは,トレーニングに複数のフレームを使用する既存手法よりも優れたパフォーマンスが得られることを示す。
この結果は、人気のあるビデオおよび言語データセットに強い「静的な外観バイアス」が存在することを明らかにする。
本稿では、時間的モデリングを促進するために、既存のきめ細かい行動認識データセットに基づく2つの新しい検索タスクを提案する。
論文 参考訳(メタデータ) (2022-06-07T16:28:30Z) - Efficient Video Segmentation Models with Per-frame Inference [117.97423110566963]
推論のオーバーヘッドを導入することなく、時間的一貫性を改善することに注力する。
本稿では,時間的一貫性の喪失やオンライン/オフラインの知識蒸留手法など,ビデオシーケンスから学ぶためのいくつかの手法を提案する。
論文 参考訳(メタデータ) (2022-02-24T23:51:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。