論文の概要: Multimodal Surface EMG Hand Gesture Recognition Using Query-Based Transformers for Prosthetic Control
- arxiv url: http://arxiv.org/abs/2607.22779v1
- Date: Fri, 24 Jul 2026 09:03:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.875926
- Title: Multimodal Surface EMG Hand Gesture Recognition Using Query-Based Transformers for Prosthetic Control
- Title(参考訳): 補綴制御のためのクエリベース変換器を用いたマルチモーダル表面EMGハンドジェスチャ認識
- Authors: Federico Del Pup, Elisa Tentori, Manfredo Atzori,
- Abstract要約: 本研究では,シームレスなマルチモーダル統合のためのハイブリッド畳み込み変換器であるEMG-CrossFormerを紹介する。
sEMGのみを使用して、EMG-CrossFormerは平均精度72.33%、52.48%、79.16%、DB2、DB3、DB7、DB10で73.49%を達成した。
- 参考スコア(独自算出の注目度): 0.04498067030425889
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hand gesture recognition via surface electromyography (sEMG) is fundamental to prosthetic control. In this field, deep learning approaches have become the gold standard. However, current architectures struggle to scale; model performance typically decreases as the number of hand movements increases. Performance degradation is tied to the increased statistical complexity of decoding expanded gesture sets and compounded by the limitations of state-of-the-art methods, which primarily rely on low-latency unimodal convolutional architectures. Convolutions operate locally, limiting model's ability to capture long-range sequential patterns. Unimodal setups cannot leverage complementary information from coordinated signals characterizing movement execution, such as inertial and eye-tracking data. These limitations motivate architectures that integrate local and global features across multimodal physiological sequences. To bridge this gap, this study introduces EMG-CrossFormer, an end-to-end hybrid convolutional-transformer for seamless multimodal integration. EMG-CrossFormer combines representations from an arbitrary number of unimodal encoders through cascaded cross-attention fusion layers, and decodes the fused representations using learnable gesture queries. EMG-CrossFormer was evaluated on four NinaPro datasets (DB2, DB3, DB7, and DB10) and benchmarked against six state-of-the-art models using an increasing number of modalities. Using only sEMG, EMG-CrossFormer achieved mean accuracies of 72.33%, 52.48%, 79.16%, and 73.49% on DB2, DB3, DB7, and DB10, respectively. Incorporating inertial signals improved performance to 90.66%, 80.40%, 92.79%, and 92.06%. These results show that joint local-global feature modeling improves sEMG-only decoding and that multimodal fusion substantially amplifies this benefit, underscoring the value of both design principles for complex hand gesture recognition.
- Abstract(参考訳): 表面筋電図(sEMG)による手のジェスチャー認識は補綴制御の基礎となる。
この分野では、ディープラーニングアプローチがゴールドスタンダードになっています。
しかし、現在のアーキテクチャではスケールが困難であり、手の動きが増加するにつれてモデルの性能が低下する。
性能劣化は、拡張されたジェスチャセットの復号化による統計的複雑さの増大と結びついており、主に低レイテンシの単調な畳み込みアーキテクチャに依存する最先端の手法の制限によって複雑化されている。
畳み込みは局所的に動作し、モデルが長距離のシーケンシャルパターンをキャプチャする能力を制限する。
一様セットアップでは、慣性や視線追跡データなどの運動実行を特徴付ける座標信号から補完的な情報を利用することができない。
これらの制限は、マルチモーダルな生理的シーケンスにまたがる局所的特徴と大域的特徴を統合するアーキテクチャを動機付けている。
このギャップを埋めるために、シームレスなマルチモーダル統合のためのエンドツーエンドハイブリッド畳み込み変換器であるEMG-CrossFormerを導入する。
EMG-CrossFormerは任意の数のユニモーダルエンコーダからの表現をカスケードされたクロスアテンション融合層に結合し、学習可能なジェスチャクエリを使って融合表現をデコードする。
EMG-CrossFormerは4つのNinaProデータセット(DB2、DB3、DB7、DB10)で評価され、多くのモダリティを用いて6つの最先端モデルに対してベンチマークされた。
sEMGのみを使用して、EMG-CrossFormerは平均精度72.33%、52.48%、79.16%、DB2、DB3、DB7、DB10で73.49%を達成した。
慣性信号の導入により性能は90.66%、80.40%、92.79%、92.06%向上した。
これらの結果から, 共同局所言語特徴モデリングは, sEMGのみの復号化を向上し, マルチモーダル融合は, この利点を著しく増幅し, 複雑な手動作認識における両設計原則の意義を浮き彫りにした。
関連論文リスト
- Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition [60.20529806857076]
マルチモーダル感情認識は、テキスト、ビデオ、音声などの手がかりを融合させ、個人の感情状態を理解する。
従来の手法では、機械的に独立な単調なパフォーマンスに依存することと、感情タスクで要求されるきめ細かい表現と相反する粗粒の融合という2つの主な制限に直面していた。
我々は,マルチスケールバンド分解とエキスパートコラボレーションを通じて,微細な相補的特徴をモデル化するために,Atsukoという名前のComplementarity-Supervised Multi-Band Expert Networkを提案する。
論文 参考訳(メタデータ) (2026-03-07T03:58:48Z) - GCMCG: A Clustering-Aware Graph Attention and Expert Fusion Network for Multi-Paradigm, Multi-task, and Cross-Subject EEG Decoding [0.7871262900865523]
運動画像(MI)脳波(EEG)信号に基づく脳-コンピュータインタフェース(BCI)は、人間と機械の相互作用の直接的な経路を提供する。
本稿では,MI-ME EEGデコーディングのための新しい統合フレームワークであるGraph-guided Clustering Mixture-of-Experts CNNGRUGを提案する。
論文 参考訳(メタデータ) (2025-11-29T18:05:33Z) - UniMRSeg: Unified Modality-Relax Segmentation via Hierarchical Self-Supervised Compensation [104.59740403500132]
マルチモーダルイメージセグメンテーションは、不完全/破損したモダリティの劣化による実際のデプロイメント課題に直面している。
階層型自己教師型補償(HSSC)による統一Modality-relaxセグメンテーションネットワーク(UniMRSeg)を提案する。
我々のアプローチは、入力レベル、特徴レベル、出力レベルをまたいだ完全なモダリティと不完全なモダリティの間の表現ギャップを階層的に橋渡しします。
論文 参考訳(メタデータ) (2025-09-19T17:29:25Z) - Improving Progressive Generation with Decomposable Flow Matching [50.63174319509629]
Decomposable Flow Matching (DFM)は、ビジュアルメディアのプログレッシブな生成のためのシンプルで効果的なフレームワークである。
Imagenet-1k 512pxでは、DFMはベースアーキテクチャよりも35.2%改善され、ベースラインは26.4%向上した。
論文 参考訳(メタデータ) (2025-06-24T17:58:02Z) - WaveFormer: A Lightweight Transformer Model for sEMG-based Gesture Recognition [14.124553708665117]
WaveFormerは、sEMGジェスチャー認識用に設計された軽量トランスフォーマーベースのアーキテクチャである。
我々のモデルは、新しい学習可能なウェーブレット変換によって時間領域と周波数領域の機能を統合し、特徴抽出を強化する。
たった3100万のパラメータで、WaveFormerはEPN612データセットの95%の分類精度を達成し、より大きなモデルを上回っている。
論文 参考訳(メタデータ) (2025-06-12T04:07:11Z) - VRS-UIE: Value-Driven Reordering Scanning for Underwater Image Enhancement [104.78586859995333]
状態空間モデル(SSM)は、線形複雑性と大域的受容場のために、視覚タスクの有望なバックボーンとして登場した。
大型で均質だが無意味な海洋背景の優位性は、希少で価値ある標的の特徴表現応答を希薄にすることができる。
水中画像強調(UIE)のための新しい値駆動リダクションスキャンフレームワークを提案する。
本フレームワークは, 水バイアスを効果的に抑制し, 構造や色彩の忠実さを保ち, 優れた向上性能(WMambaを平均0.89dB超える)を実現する。
論文 参考訳(メタデータ) (2025-05-02T12:21:44Z) - Any Image Restoration via Efficient Spatial-Frequency Degradation Adaptation [158.37640586809187]
劣化した画像を1つのモデルで効率的に復元することは、ますます重要になっている。
我々のアプローチはAnyIRと呼ばれ、様々な劣化にまたがる固有の類似性を活用する統一された経路をとっています。
劣化認識と文脈的注意を融合させるため,空間周波数並列融合戦略を提案する。
論文 参考訳(メタデータ) (2025-04-19T09:54:46Z) - Restore Anything Model via Efficient Degradation Adaptation [129.38475243424563]
RAMは、様々な劣化にまたがる固有の類似性を活用して、効率的で包括的な復元を可能にする統一された経路を取る。
RAMのSOTA性能はRAMのSOTA性能を確認し、トレーニング可能なパラメータで約82%、FLOPで約85%のモデルの複雑さを減少させる。
論文 参考訳(メタデータ) (2024-07-18T10:26:53Z) - A Multi-label Classification Approach to Increase Expressivity of
EMG-based Gesture Recognition [4.701158597171363]
本研究の目的は,表面筋電図に基づくジェスチャー認識システム(SEMG)の表現性を効率的に向上することである。
動作を2つのバイオメカニカルな独立したコンポーネントに分割する問題変換アプローチを用いる。
論文 参考訳(メタデータ) (2023-09-13T20:21:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。