論文の概要: Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies
- arxiv url: http://arxiv.org/abs/2605.24302v2
- Date: Tue, 26 May 2026 22:04:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:54.956934
- Title: Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies
- Title(参考訳): マンバを用いたエゴセントリックビデオにおけるクロスモーダルな行動認識:CRSトーケン融合戦略によるRGBとハンドスケルトンストリームの統合
- Abstract要約: 本稿では,RGBビデオと時間的手関節データを組み合わせたクロスモーダルアーキテクチャを提案する。
私たちのアーキテクチャは,視覚的特徴抽出のためのVideoMambaモジュール,Mambaブロックのスタック上に構築されたスケルトンエンコーダ,両モジュールを単一の表現に統合する融合モジュールの3つのコンポーネントで構成されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Egocentric action recognition is a challenging task due to erratic camera motion, frequent hand occlusion, and the difficulty of maintaining consistent visual representations over time. In this work, we propose a cross-modal architecture that combines RGB video and temporal hand skeleton data within a unified Mamba-based framework, exploiting the linear time complexity of State Space Models (SSMs). Our architecture consists of three components: a VideoMamba module for visual feature extraction, a skeleton encoder built on a stack of Mamba blocks, and a fusion module that integrates both modalities into a single representation. A central contribution of this work is the design and evaluation of four Class (CLS) token mixing strategies for multimodal fusion: Naive, Average, Weighted and Context-based. These strategies differ in how the pretrained unimodal CLS tokens, which role is to act as information sinks concentrating learned representations, are leveraged to initialize the mixed CLS token used for final classification. We evaluate all strategies on the H2O dataset. Experimental results show that the Average strategy achieves the best performance, yielding gains of over 10% Top-1 accuracy in the Tiny configuration and 2% in the Small configuration over the VideoMamba baseline.
- Abstract(参考訳): エゴセントリックな行動認識は、不規則なカメラの動き、頻繁な手の閉塞、時間の経過とともに一貫した視覚的表現を維持することの難しさによって難しい課題である。
本研究では,状態空間モデル(SSM)の線形時間的複雑性を利用して,RGBビデオと時間的手骨格データを統一したMambaベースのフレームワークで組み合わせたクロスモーダルアーキテクチャを提案する。
私たちのアーキテクチャは,視覚的特徴抽出のためのVideoMambaモジュール,Mambaブロックのスタック上に構築されたスケルトンエンコーダ,両モジュールを単一の表現に統合する融合モジュールの3つのコンポーネントで構成されている。
この研究の中心的な貢献は、多モード核融合のための4つのクラス(CLS)トークン混合戦略(Naive, Average, Weighted, Context-based)の設計と評価である。
これらの戦略は、学習表現を集中させる情報シンクとして機能し、最終分類に使用される混合CLSトークンを初期化するために活用される、事前訓練されたユニモーダルCRSトークンとの違いである。
H2Oデータセット上のすべての戦略を評価する。
実験結果から,Tiny構成では10%以上のTop-1精度,VideoMambaベースラインでは2%以上のSmall構成が得られた。
関連論文リスト
- When Simplicity Wins: Bottleneck-Aware Context Modeling for Lightweight Semantic Segmentation [58.325533783810016]
セマンティックセグメンテーションのための軽量で効果的なフレームワークSiConMoを提案する。
極めて低い計算予算では、ボトルネックは局所的およびグローバル的コンテキストを統合する上で最も効率的な段階である。
ADE20K、PASCALコンテキスト、Cityscapes、COCO-Stuffに関する実験では、SiConMoが最先端の精度と効率のトレードオフを達成することを示した。
論文 参考訳(メタデータ) (2026-08-19T14:47:07Z) - MSCM-net: A hyperspectral image classiffcation method based on multi-scale convolution and Mamba [10.40281964904095]
本稿では,革新的なハイパースペクトル画像分類モデルMSCM-netを提案する。
マルチスケールCNNとMambaを組み合わせたモデルアーキテクチャで構成されている。
計算複雑性を低減しつつ、高度な分類性能を実現することができる。
論文 参考訳(メタデータ) (2026-07-30T14:27:59Z) - MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning [15.707226798418]
大規模ビデオデータからの自己教師付き学習が視覚表現学習の主流のパラダイムとして浮上している。
既存の方法は、モダリティ固有のエンコーダと、コントラストや再構成目的の複雑な組み合わせに依存している。
両モードで単一の統一エンコーダを使用する音声・視覚学習のための共同埋め込み型予測アーキテクチャであるMJEPAを紹介する。
論文 参考訳(メタデータ) (2026-06-23T22:48:42Z) - ConvVitMamba: Efficient Multiscale Convolution, Transformer, and Mamba-Based Sequence modelling for Hyperspectral Image Classification [2.538209532048867]
ハイパスペクトル画像(HSI)分類は、高スペクトル次元、冗長性、ラベル付きデータによって依然として困難である。
ConvVitMambaと呼ばれる統合ハイブリッドフレームワークが、効率的なHSI分類のために提案されている。
このアーキテクチャは、3つのコンポーネントを統合する: 局所スペクトル、空間、関節パターンをキャプチャするマルチスケール畳み込み特徴抽出器、グローバルなコンテキスト関係をモデル化するビジョントランスフォーマーベースのトークン化とエンコーディングステージ、効率的なコンテンツ認識のための軽量なMambaインスパイアされたゲート配列混合モジュール。
論文 参考訳(メタデータ) (2026-04-20T21:26:51Z) - Complementary and Contrastive Learning for Audio-Visual Segmentation [74.11434759171199]
本稿では,ローカル情報とグローバル情報の両方を処理可能な新しいフレームワークであるComplementary and Contrastive Transformer(CCFormer)を提案する。
提案手法は,S4, MS3, AVSSデータセットにまたがる最先端のベンチマークを新たに設定する。
論文 参考訳(メタデータ) (2025-10-11T06:36:59Z) - LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks [27.57718303520023]
軽量適応Cue-Aware Vision Mambaネットワークを提案する。
マルチモーダルひび割れのシナリオ下で、異なるモーダルから形態的およびテクスチャ的手がかりを効率よく知覚し、統合する。
本手法はF1では0.8204、mIoUでは0.8465、パラメータは5.35Mである。
論文 参考訳(メタデータ) (2025-07-30T08:28:20Z) - VRS-UIE: Value-Driven Reordering Scanning for Underwater Image Enhancement [104.78586859995333]
状態空間モデル(SSM)は、線形複雑性と大域的受容場のために、視覚タスクの有望なバックボーンとして登場した。
大型で均質だが無意味な海洋背景の優位性は、希少で価値ある標的の特徴表現応答を希薄にすることができる。
水中画像強調(UIE)のための新しい値駆動リダクションスキャンフレームワークを提案する。
本フレームワークは, 水バイアスを効果的に抑制し, 構造や色彩の忠実さを保ち, 優れた向上性能(WMambaを平均0.89dB超える)を実現する。
論文 参考訳(メタデータ) (2025-05-02T12:21:44Z) - An Efficient and Mixed Heterogeneous Model for Image Restoration [71.85124734060665]
現在の主流のアプローチは、CNN、Transformers、Mambasの3つのアーキテクチャパラダイムに基づいている。
混合構造融合に基づく効率的で汎用的なIRモデルであるRestorMixerを提案する。
論文 参考訳(メタデータ) (2025-04-15T08:19:12Z) - TransMamba: Fast Universal Architecture Adaption from Transformers to Mamba [66.80624029365448]
本稿では,Transformer事前学習知識の再利用を容易にするクロスアーキテクチャな知識伝達パラダイムであるTransMambaを提案する。
本稿では,マンバをベースとしたモデルのトレーニングを高速化する2段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-21T01:22:01Z) - The Devil is in Temporal Token: High Quality Video Reasoning Segmentation [68.33080352141653]
ビデオ推論の方法は、ビデオ内のオブジェクトを表現するために単一の特別なトークンに大きく依存する。
エンドツーエンドの動画推論セグメンテーション手法であるVRS-HQを提案する。
提案手法の強い時間的推論とセグメンテーション能力について検討した。
論文 参考訳(メタデータ) (2025-01-15T03:17:24Z) - Multi-Modality Co-Learning for Efficient Skeleton-based Action Recognition [12.382193259575805]
本稿では,効率的な骨格に基づく行動認識のための多モード協調学習(MMCL)フレームワークを提案する。
MMCLフレームワークは,トレーニング期間中に多要素協調学習を行い,推論に簡潔な骨格のみを用いることで効率を向上する。
論文 参考訳(メタデータ) (2024-07-22T15:16:47Z) - Learning from Temporal Spatial Cubism for Cross-Dataset Skeleton-based
Action Recognition [88.34182299496074]
アクションラベルはソースデータセットでのみ利用可能だが、トレーニング段階のターゲットデータセットでは利用できない。
我々は,2つの骨格に基づく行動データセット間の領域シフトを低減するために,自己スーパービジョン方式を利用する。
時間的セグメントや人体部分のセグメンテーションとパーフォーミングにより、我々は2つの自己教師あり学習分類タスクを設計する。
論文 参考訳(メタデータ) (2022-07-17T07:05:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。