論文の概要: TubeLite: Lightweight Multi-Actor Spatio-Temporal Action Detection
- arxiv url: http://arxiv.org/abs/2607.04684v1
- Date: Mon, 06 Jul 2026 05:12:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.049119
- Title: TubeLite: Lightweight Multi-Actor Spatio-Temporal Action Detection
- Title(参考訳): TubeLite: 軽量マルチアクター時空間動作検出
- Abstract要約: TubeLiteはビデオの時間的行動検出のための軽量なフレームワークである。
安定管構築と境界対応時間モデルに焦点を当てている。
コンパクトな設計にもかかわらず、強力なビデオレベルのローカライゼーション性能を実現する。
- 参考スコア(独自算出の注目度): 74.20082571588867
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spatio-temporal action detection in videos requires jointly localizing actors in space and identifying action boundaries over time. A common challenge is constructing temporally stable action tubes, as frame-level detectors often suffer from jitter, fragmentation, and imprecise temporal localization. Many recent approaches address this by introducing heavy spatio-temporal transformers or optical-flow-based pipelines, leading to high computational cost and limited scalability. We propose TubeLite, a lightweight framework for spatio-temporal action detection that focuses on stable tube construction and boundary-aware temporal modeling. TubeLite represents each actor as a tube, defined as a sequence of bounding boxes associated with a single actor over time, and explicitly enforces temporal consistency at both the spatial and semantic levels. The method combines low-jitter actor detection, Gaussian-weighted actor feature extraction, efficient short-term temporal propagation, and a boundary-focused temporal prediction head, while avoiding optical flow and large-scale temporal attention. Despite its compact design, TubeLite achieves strong video-level localization performance. It improves Video-mAP@0.5 by 4.5 and 7.1 percentage points over the best compared method on the MultiSports and UCF101-24 datasets, respectively, with substantially fewer parameters and floating-point operations than transformer-based alternatives, demonstrating that effective spatio-temporal action detection can be obtained through principled, lightweight temporal modeling.
- Abstract(参考訳): ビデオにおける時空間的行動検出には、空間内のアクターを共同でローカライズし、時間とともにアクション境界を特定する必要がある。
一般的な課題は、フレームレベルの検出器がジッタ、断片化、不正確な時間的局所化に悩まされるため、時間的に安定な動作管を構築することである。
最近の多くのアプローチでは、重い時空間変換器や光フローベースのパイプラインを導入し、高い計算コストと限られたスケーラビリティを実現している。
本研究では,安定な管構築と境界対応時間モデルに着目した時空間行動検出のための軽量フレームワークであるTubeLiteを提案する。
TubeLiteは各アクターをチューブとして表現し、時間とともに単一のアクターと関連付けられたバウンディングボックスのシーケンスとして定義し、空間レベルと意味レベルの両方で時間的一貫性を明示的に強制する。
低ジッタアクタ検出、ガウス重み付きアクタ特徴抽出、効率的な短期的伝搬、および境界中心の時間予測ヘッドを光学的流れと大規模時間的注意を回避しつつ組み合わせる。
コンパクトな設計にもかかわらず、TuneLiteは強力なビデオレベルのローカライゼーション性能を実現している。
また、MultiSportsとUCF101-24データセットの最良の比較法に比べて、ビデオ-mAP@0.5を4.5倍、7.1パーセンテージで改善し、トランスフォーマーベースの代替案よりもパラメータと浮動小数点演算を著しく少なくし、原理的かつ軽量な時間的モデリングによって効果的な時空間行動検出が得られることを示した。
関連論文リスト
- Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding [80.10744910189997]
マルチモーダルな言語モデルは通常、トラジェクトリを自動回帰的にシリアライズする。
時間ブロックにグラウンドを分解する生成式であるParallel Tube Decoding (PTD)を導入する。
VidSTGでは、PTDチューブはコンプリートを79倍に減らし、空間デコーディングを92倍に向上させる。
論文 参考訳(メタデータ) (2026-08-28T11:05:30Z) - LiveLight: Real-time Streaming Video Relighting with Interactive Control [50.08584152649119]
インタラクティブな3Dライティング制御を備えたリアルタイムストリーミングビデオリライティングのための,最初の拡散ベースのフレームワークであるLiveLightを紹介する。
拡散モデルに動的3D照明を効果的に注入し、低NFE予算下で高忠実度生成を維持し、対話型制御のための連続ストリーミングを容易にするという3つの重要な課題を克服する。
実世界のベンチマークと合成ベンチマークの実験は、LiveLightがリアルタイムに実行しながら最先端のリライト品質を達成することを示した。
論文 参考訳(メタデータ) (2026-08-03T06:45:00Z) - Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification [11.171207895220578]
長いビデオの時間的接地には、正確な時間的局所化と、自然言語クエリで条件付けられた頑健なオブジェクト追跡が必要である。
本稿では,フレームレベルから第2レベルのトラッキングへ移行し,シーケンス長を低減しつつ連続性を保ちながら秒間アノテーションを実行する実用的なパイプラインを提案する。
論文 参考訳(メタデータ) (2026-06-27T17:42:32Z) - Learning to Recognize Correctly Completed Procedure Steps in Egocentric Assembly Videos through Spatio-Temporal Modeling [11.720299001244976]
手順ステップ認識(PSR)のための2重ストリームフレームワークを提案する。
STORM-PSRはMECCANOとIndustRealのデータセットで評価される。
実際の組立工程の完了までの平均遅延を、それぞれ11.2%、26.1%削減する。
論文 参考訳(メタデータ) (2025-10-14T11:03:30Z) - Towards Robust and Generalizable Continuous Space-Time Video Super-Resolution with Events [71.2439653098351]
連続時空ビデオスーパーSTVSRは、高解像度で高フレームのビデオを任意の時間スケールで再構成する能力への関心が高まっている。
EvEnhancerは、イベントストリームにカプセル化された高時間および高ダイナミックレンジのユニークな特性を結合する新しいアプローチである。
提案手法は,OODスケールでの一般化性を維持しつつ,合成および実世界の両方のデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2025-10-04T15:23:07Z) - CETUS: Causal Event-Driven Temporal Modeling With Unified Variable-Rate Scheduling [18.82030002020162]
イベントカメラは、マイクロ秒時間解像度で非同期ピクセルレベルの輝度変化をキャプチャする。
既存の方法では、イベントストリームをフレーム、ボクセルグリッド、ポイントクラウドなどの中間表現に変換することが多い。
本稿では、中間表現なしで生イベントストリームを直接処理する新しいアーキテクチャである可変レート空間イベントマンバを提案する。
論文 参考訳(メタデータ) (2025-09-17T07:55:37Z) - StreamFlow: Streamlined Multi-Frame Optical Flow Estimation for Video
Sequences [31.210626775505407]
連続するフレーム間のオクルージョンは、長い間、光学的フロー推定において重要な課題を提起してきた。
本稿では,ビデオ入力に適したストリーム・イン・バッチ・マルチフレーム(SIM)パイプラインを提案する。
StreamFlowは、挑戦的なKITTIとSintelデータセットのパフォーマンスだけでなく、排他的領域でも特に改善されている。
論文 参考訳(メタデータ) (2023-11-28T07:53:51Z) - An Efficient Spatio-Temporal Pyramid Transformer for Action Detection [40.68615998427292]
動作検出のための効率的な階層型時空間ピラミッド変換(STPT)ビデオフレームワークを提案する。
具体的には,早期の局所的時間的リッチタイム表現を符号化するために,局所的ウィンドウアテンションを用いて,後期の長期的時空間依存を捕捉するためにグローバルなアテンションを適用することを提案する。
このように、当社のSTPTは、局所性と依存性の両方を大幅に冗長化してエンコードすることができ、正確性と効率の両立を期待できるトレードオフを提供します。
論文 参考訳(メタデータ) (2022-07-21T12:38:05Z) - TubeDETR: Spatio-Temporal Video Grounding with Transformers [89.71617065426146]
与えられたテキストクエリに対応するビデオにおいて、アテンポラルチューブをエンコーダでローカライズする問題について考察する。
この課題に対処するために,テキスト条件付きオブジェクト検出における近年の成功に触発された変換器アーキテクチャであるTubeDETRを提案する。
論文 参考訳(メタデータ) (2022-03-30T16:31:49Z) - Augmented Transformer with Adaptive Graph for Temporal Action Proposal
Generation [79.98992138865042]
TAPGの長期的および局所的時間的コンテキストを利用するための適応グラフネットワーク(ATAG)を備えた拡張トランスを提案する。
具体的には、スニペット動作損失と前部ブロックを装着し、拡張トランスと呼ばれるバニラトランスを強化する。
位置情報と隣接特徴の差異をマイニングすることで局所時間文脈を構築するための適応型グラフ畳み込みネットワーク(gcn)を提案する。
論文 参考訳(メタデータ) (2021-03-30T02:01:03Z) - Intrinsic Temporal Regularization for High-resolution Human Video
Synthesis [59.54483950973432]
時間整合性は、画像処理パイプラインをビデオドメインに拡張する上で重要である。
フレームジェネレーターを介して本質的信頼度マップを推定し,運動推定を調節する,本質的な時間正規化方式を提案する。
我々は、本質的な時間的規制をシングルイメージジェネレータに適用し、強力な「Internet」が512Times512$の人間のアクションビデオを生成します。
論文 参考訳(メタデータ) (2020-12-11T05:29:45Z) - PAN: Towards Fast Action Recognition via Learning Persistence of
Appearance [60.75488333935592]
最先端のほとんどの手法は、動きの表現として密度の高い光の流れに大きく依存している。
本稿では,光学的フローに依存することで,高速な動作認識に光を当てる。
我々はPersistence of Outearance(PA)と呼ばれる新しい動きキューを設計する。
光学的流れとは対照的に,我々のPAは境界における運動情報の蒸留に重点を置いている。
論文 参考訳(メタデータ) (2020-08-08T07:09:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。