論文の概要: VideoSEMA: a scalable and efficient Mamba-like attention for video understanding
- arxiv url: http://arxiv.org/abs/2607.14711v2
- Date: Fri, 17 Jul 2026 20:57:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.638438
- Title: VideoSEMA: a scalable and efficient Mamba-like attention for video understanding
- Title(参考訳): VideoSEMA: ビデオ理解のためのスケーラブルで効率的なMambaライクな注意力
- Abstract要約: 我々は,分割された時空アテンションモデルであるVideoSEMAについて,ビデオ理解(分類)を提案する。
SEMAは、空間におけるスケーラブルで効率的なマンバ様の注意ブロック(SEMA)と、時間におけるソフトマックスの時間的注意で構成される。
ベンチマークK400データセットでは、VideoSEMAはより重い視覚変換器とMambaモデルより優れています。
VideoSEMAは、拡張された時間的注意を払って、より長いビデオに拡張することが約束されている。
- 参考スコア(独自算出の注目度): 6.244421951898815
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present for video understanding (classification) a split space-time attention model, VideoSEMA, consisting of a scalable and efficient Mamba-like attention (SEMA) block in space and a softmax temporal attention in time. In each frame, SEMA attention applies a local window attention in parallel with a global averaging in a Mamba macro-architecture, which is called Mamba-like. Under certain rank conditions, we prove that the computationally cheaper split space-time attention is equivalent to full space-time attention. On benchmark K400 data sets, VideoSEMA out-performs heavier vision transformer and Mamba models. On benchmark SSv2 data, VideoSEMA leads in top-1 accuracy among models of similar parameter sizes. As image resolution scales up from standard $224^2$ to $1024^2$ on K400 and without fine-tuning, VideoSEMA degrades much more gracefully than VideoMamba in accuracy. It is promising to extend VideoSEMA to longer videos with a dilated/sparse temporal attention.
- Abstract(参考訳): 本稿では,空間におけるスケーラブルで効率的なMamba-like attention(SEMA)ブロックと,時間におけるソフトマックス時間的アテンションからなる,分割された時空アテンションモデルVideoSEMAを提案する。
各フレームにおいて、SEMAアテンションは、Mamba-likeと呼ばれるMambaマクロ構造において、グローバルな平均化と平行して局所的なウィンドウアテンションを適用する。
あるランク条件下では、計算的に安価に分割された時空の注意が全時空の注意と等価であることを示す。
ベンチマークK400データセットでは、VideoSEMAはより重い視覚変換器とMambaモデルより優れています。
ベンチマークSSv2データでは、VideoSEMAが同様のパラメータサイズのモデルでトップ1の精度でリードする。
画像の解像度が標準の224^2ドルから1024^2ドルへとK400で上がり、微調整が不要になるにつれて、VideoSEMAはVideoMambaよりも精度的に格段に低下する。
VideoSEMAは、拡張された時間的注意を払って、より長いビデオに拡張することが約束されている。
関連論文リスト
- HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling [52.10845971383909]
HieraMambaは階層的なアーキテクチャで、時間的構造と規模にわたって意味的な豊かさを保ちます。
Ego4D-NLQ、MAD、TACoSに新たな最先端技術を導入し、長い、トリミングされていないビデオの正確な時間的忠実なローカライゼーションを実証した。
論文 参考訳(メタデータ) (2025-10-27T06:13:07Z) - A2Mamba: Attention-augmented State Space Models for Visual Recognition [45.68176825375723]
本稿では,トランスフォーマー-マンバハイブリッドネットワークアーキテクチャであるA2Mambaを提案する。
A2SSMのキーステップは、空間的にSSMの隠された状態を集約することで、異種交叉アテンションを実行する。
私たちのA2Mambaは、視覚認識タスクにおいて、以前のConvNet-、Transformer-、およびMambaベースのアーキテクチャよりも優れています。
論文 参考訳(メタデータ) (2025-07-22T14:17:08Z) - Mamba-OTR: a Mamba-based Solution for Online Take and Release Detection from Untrimmed Egocentric Video [57.805927523341516]
Mamba-OTRは、短いビデオクリップでトレーニングしながら、推論中に時間的再発を利用するように設計されている。
Mamba-OTRは、スライドウインドウ方式で動作する際に、注目すべきmp-mAP45.48を達成する。
我々は,今後の研究を支援するため,Mamba-OTRのソースコードを公開します。
論文 参考訳(メタデータ) (2025-07-22T08:23:51Z) - SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models [93.73583158211115]
ビデオにおけるきめ細かい時間的理解の獲得は、現在のビデオ大マルチモデル(ビデオLMM)にとって大きな課題である。
私たちは、データセット、モデル、ベンチマークの3つの中核的な側面に貢献しています。
まず,ビデオ理解,グラウンドニング,マルチターンビデオチャットの共用学習を実現するため、15Kビデオからなる大規模データセットであるSAMA-239Kを紹介する。
第2に,広義の時間的コンテキストアグリゲータとセグメンションモデルを組み合わせたSAMAモデルを提案する。
論文 参考訳(メタデータ) (2025-05-24T18:13:16Z) - Vamba: Understanding Hour-Long Videos with Hybrid Mamba-Transformers [38.63270256142439]
State-of-the-the-art transformer-based large multimodal model (LMM)は、1時間のビデオ入力を扱うのに苦労する。
我々は,ビデオトークンを線形複雑にエンコードするために,Mamba-2ブロックを用いたハイブリッドMamba-Transformerモデル(VAMBA)を構築した。
VAMBAは、トレーニングと推論中のGPUメモリ使用量の少なくとも50%削減を実現し、トレーニングステップあたりの速度をほぼ2倍にします。
論文 参考訳(メタデータ) (2025-03-14T16:45:23Z) - Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing [52.050036778325094]
Video-Ma$2$mbaは、Mamba-2フレームワークにステートスペースモデル(SSM)を組み込んだ新しいアーキテクチャである。
本手法は,標準勾配チェックポイントに比べてメモリフットプリントを大幅に削減する。
時間的ダイナミクスの詳細なキャプチャーを維持することで、長いビデオ理解タスクにおける応答の精度と関連性を改善することができる。
論文 参考訳(メタデータ) (2024-11-29T04:12:13Z) - VideoMamba: Spatio-Temporal Selective State Space Model [18.310796559944347]
VideoMambaは、ビデオ認識用に特別に設計された純粋なMambaアーキテクチャの斬新な適応である。
VideoMambaは、リソース効率だけでなく、ビデオの長距離依存性のキャプチャにも有効だ。
我々の研究は、ビデオ理解のための強力なツールとしてのVideoMambaの可能性を強調し、ビデオ分析における将来の研究のための、シンプルだが効果的なベースラインを提供する。
論文 参考訳(メタデータ) (2024-07-11T13:11:21Z) - Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding [49.88140766026886]
状態空間モデルMambaは、長周期モデリングからビデオモデリングへの成功を拡大する有望な特性を示している。
我々は、マンバがビデオのモデリングにおいて様々な役割を担い、マンバが優位性を示す様々なタスクを調査しながら、包括的な研究を行う。
実験の結果,ビデオ専用タスクとビデオ言語タスクの両方において,Mambaの強い可能性を示すとともに,有望な効率と性能のトレードオフを示すことができた。
論文 参考訳(メタデータ) (2024-03-14T17:57:07Z) - BlackMamba: Mixture of Experts for State-Space Models [10.209192169793772]
状態空間モデル(SSM)は、最近、大規模な言語モデリングベンチマークでトランスフォーマーと競合する性能を示した。
MoEモデルは、計算コストと遅延コストを大幅に削減しながら、顕著なパフォーマンスを示している。
我々は,Mamba SSMとMoEを組み合わせた新しいアーキテクチャであるBlackMambaを紹介した。
論文 参考訳(メタデータ) (2024-02-01T07:15:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。