論文の概要: TReViS: Temporal Repetition Structure Aware Video Synthesis for Self-supervised Repetitive Action Counting
- arxiv url: http://arxiv.org/abs/2609.24367v1
- Date: Mon, 21 Sep 2026 09:59:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.250278
- Title: TReViS: Temporal Repetition Structure Aware Video Synthesis for Self-supervised Repetitive Action Counting
- Title(参考訳): TReViS: 自己監督型反復行動計数のためのビデオ合成を意識した時間繰り返し構造
- Abstract要約: TReViSは、繰り返しラベルなしでRACモデルのトレーニングを可能にする、自己教師付きビデオ合成フレームワークである。
時間的自己相似行列を用いて、ラベルのないビデオの時間的繰り返し構造を推定する。
時間的変動を制御しながら、現実的な反復パターンを保存する新しいトレーニングシーケンスを合成する。
- 参考スコア(独自算出の注目度): 10.584629283098304
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Fully supervised repetitive action counting (RAC) has achieved strong performance, but requires dense temporal annotations that are costly and difficult to scale. We propose TReViS, a self-supervised video synthesis framework that enables training RAC models without any repetition labels. TReViS estimates the underlying temporal repetition structure of an unlabeled video via a Temporal Self-Similarity Matrix, infers its cycle statistics, and synthesizes new training sequences that preserve realistic repetition patterns while introducing controlled temporal variability. These synthesized videos are paired with pseudo-labels and used to train existing RAC architectures from scratch. Across multiple datasets and backbones, TReViS consistently outperforms prior self-supervised methods and achieves performance competitive with several supervised baselines, while remaining fully label-free, demonstrating the effectiveness of structure-aware video synthesis for label-free RAC. The source code is available at https://github.com/yfqi/TReViS.
- Abstract(参考訳): 完全教師付き反復行動計数(RAC)は高い性能を達成しているが、高コストで拡張が難しい時間的アノテーションを必要とする。
本稿では,繰り返しラベルを使わずにRACモデルをトレーニング可能な自己教師付きビデオ合成フレームワークであるTReViSを提案する。
TReViSは、時間的自己相似行列を用いて、ラベルのないビデオの時間的繰り返し構造を推定し、そのサイクル統計を推定し、制御された時間的変動を導入しながら、現実的な反復パターンを保存する新しいトレーニングシーケンスを合成する。
これらの合成ビデオは擬似ラベルと組み合わせられ、既存のRACアーキテクチャをゼロからトレーニングするために使用される。
複数のデータセットとバックボーンにわたって、TReViSは従来よりも一貫して優れており、ラベルのないRACのための構造認識ビデオ合成の有効性を実証しながら、いくつかの教師付きベースラインと競合するパフォーマンスを実現している。
ソースコードはhttps://github.com/yfqi/TReViS.comで入手できる。
関連論文リスト
- STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models [81.32710031596591]
ビデオ推論タスクには、動きの追跡、時間順、フレーム全体の視覚状態の進化が必要である。
視覚言語モデル(LVLM)上に構築された既存の手法はしばしば、チェーン・オブ・ソート(CoT)を通じて推論を外部化することでこの問題に対処する。
STORMSは,LVLMに明示的なテキストCoTではなく,有界な連続的な潜在軌道を推論する2段階のフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T16:33:00Z) - Clip-level Uncertainty and Temporal-aware Active Learning for End-to-End Multi-Object Tracking [1.2673946305606805]
動的環境におけるマルチオブジェクト追跡(MOT)は、時間とともに一貫したオブジェクトのアイデンティティを維持するために、堅牢な時間的推論に依存する。
トランスフォーマーベースのエンドツーエンドMOTモデルは、時間依存を明示的にモデル化することで、強力なパフォーマンスを達成する。
高ラベリングコストとビデオの強い冗長性を考えると、アクティブラーニング(AL)はアノテーション効率を改善する効果的なアプローチである。
論文 参考訳(メタデータ) (2026-05-11T01:33:35Z) - Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos [52.00944453189226]
時間的プリミティブをモデルに教えるポストトレーニングフレームワークであるSynRLを紹介する。
時間的理解を短期的原始(速度,方向)と長期的認知的原始に分解する。
単純な幾何学的形状のトレーニングにもかかわらず、SynRLは時間的グラウンド、複雑な推論、一般的なビデオ理解にまたがる15のベンチマークで大幅に改善されている。
論文 参考訳(メタデータ) (2026-03-18T13:10:47Z) - Unsupervised Online 3D Instance Segmentation with Synthetic Sequences and Dynamic Loss [52.28880405119483]
教師なしのオンライン3Dインスタンスのセグメンテーションは、基本的だが難しい課題だ。
UNITのような既存の手法はこの方向に進んできたが、訓練の多様性が制限されているままである。
本稿では,合成点雲列生成によるトレーニング分布の強化を目的とした新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T08:53:27Z) - Rethinking Video Tokenization: A Conditioned Diffusion-based Approach [58.164354605550194]
新しいトークン化ツールであるDiffusion Conditioned-based Gene Tokenizerは、GANベースのデコーダを条件付き拡散モデルで置き換える。
再建に基本的MSE拡散損失とKL項,LPIPSを併用した訓練を行った。
CDTのスケールダウン版(3$times inference speedup)でさえ、トップベースラインと互換性がある。
論文 参考訳(メタデータ) (2025-03-05T17:59:19Z) - ODTrack: Online Dense Temporal Token Learning for Visual Tracking [22.628561792412686]
ODTrackはビデオレベルのトラッキングパイプラインで、オンライントークンの伝搬方法でビデオフレームのコンテキスト関係を密に関連付ける。
リアルタイムの速度で実行しながら、7つのベンチマークで新しい itSOTA パフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-01-03T11:44:09Z) - Transform-Equivariant Consistency Learning for Temporal Sentence
Grounding [66.10949751429781]
ビデオ毎により差別的な表現を学習するために,新しい同変一貫性規則学習フレームワークを導入する。
私たちのモチベーションは、クエリ誘導アクティビティの時間的境界を一貫して予測することにある。
特に,ビデオの完全性と滑らか性を高めるために,自己教師付き一貫性損失モジュールを考案した。
論文 参考訳(メタデータ) (2023-05-06T19:29:28Z) - Noisy-LSTM: Improving Temporal Awareness for Video Semantic Segmentation [29.00635219317848]
本稿では,エンドツーエンドで学習可能なNoisy-LSTMという新しいモデルを提案する。
また,ビデオシーケンスのフレームをノイズに置き換える,シンプルで効果的なトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2020-10-19T13:08:15Z) - Counting Out Time: Class Agnostic Video Repetition Counting in the Wild [82.26003709476848]
本稿では,アクションがビデオで繰り返される期間を推定するためのアプローチを提案する。
アプローチの要点は、周期予測モジュールを時間的自己相似性を使用するように制約することにある。
我々は、大規模なラベルなしビデオコレクションから生成される合成データセットを用いて、Repnetと呼ばれるこのモデルをトレーニングする。
論文 参考訳(メタデータ) (2020-06-27T18:00:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。