論文の概要: A Low-Cost Hybrid Reservoir Computing Model for Isolated Sign Language Video Recognition
- arxiv url: http://arxiv.org/abs/2608.03444v1
- Date: Tue, 04 Aug 2026 10:38:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.142553
- Title: A Low-Cost Hybrid Reservoir Computing Model for Isolated Sign Language Video Recognition
- Title(参考訳): 孤立手話音声認識のための低コストハイブリッド貯留層計算モデル
- Abstract要約: 我々は手話認識(SLR)のための軽量貯水池計算(RC)に基づくアプローチを提案する。
提案手法では,身体と手指のキーポイントを抽出し,ジェスチャーの空間的・時間的ダイナミクスを捉える。
このHRCベースのSLR法は、Word-Level American Sign Language 100 (WLASL100)ビデオデータセットでそれぞれ61.12%、86.05%、92.56%のTop-1、Top-5、Top-10の精度を達成した。
- 参考スコア(独自算出の注目度): 0.2099922236065961
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sign language recognition (SLR) enhances communication between hearing and hearing-impaired individuals. Although deep learning (DL) has achieved promising performance in SLR, its high computational cost limits deployment on edge devices. To address this challenge, we propose a lightweight reservoir computing (RC)-based approach for SLR. In the proposed method, MediaPipe extracts body and hand keypoints to capture the spatial and temporal dynamics of gestures. These keypoints are then processed by a hybrid reservoir computing (HRC) architecture that combines deep reservoir computing (DRC) and bidirectional reservoir computing (BRC), transforming the input into a high-dimensional dynamic representation. A ridge regression model maps the final HRC state to class labels. This HRC-based SLR method achieved Top-1, Top-5, and Top-10 accuracies of 61.12%, 86.05%, and 92.56%, respectively, on the Word-Level American Sign Language 100 (WLASL100) video dataset, demonstrating competitive performance compared to deep learning-based approaches. Additionally, due to the lightweight nature of RC, the training time was drastically reduced to only a few seconds compared with DL-based methods such as Bi-GRU.This method offers low computational cost, showing its potential for deployment on edge devices.
- Abstract(参考訳): 手話認識(SLR)は、聴覚障害者と聴覚障害者のコミュニケーションを強化する。
ディープラーニング(DL)はSLRにおいて有望な性能を達成したが、その高い計算コストはエッジデバイスへのデプロイメントを制限する。
そこで本研究では,SLRに対する軽量貯水池計算(RC)に基づくアプローチを提案する。
提案手法では,身体と手指のキーポイントを抽出し,ジェスチャーの空間的・時間的ダイナミクスを捉える。
これらのキーポイントは、ディープ貯水池コンピューティング(DRC)と双方向貯水池コンピューティング(BRC)を組み合わせたハイブリッド貯水池コンピューティング(HRC)アーキテクチャによって処理され、入力を高次元の動的表現に変換する。
リッジ回帰モデルは、最後のHRC状態をクラスラベルにマッピングする。
このHRCベースのSLR法は、Word-Level American Sign Language 100 (WLASL100) のビデオデータセットでそれぞれ61.12%、86.05%、92.56%のTop-1、Top-5、Top-10のアキュラティを達成し、ディープラーニングベースのアプローチと比較して競合性能を実証した。
さらに, RCの軽量な性質から, Bi-GRUのようなDLベースの手法と比較して, トレーニング時間はほんの数秒に短縮され, 計算コストが低く, エッジデバイスへの展開の可能性も示された。
関連論文リスト
- CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving [66.77752555295355]
E2E-ADのための大規模強化学習(RL)を用いた閉ループ訓練システムであるCLEARを提案する。
簡単な報奨により、CLEARは従来の手法よりも大幅に優れ、新しい最先端性能を設定できることが示される。
論文 参考訳(メタデータ) (2026-07-03T00:34:50Z) - Towards End to End Motion Planning and Execution for Autonomous Underwater Vehicles Using Reinforcement Learning [2.1942030377331245]
本稿では,センサデータをスラスタコマンドに直接マッピングする,エンドツーエンドのDeep Reinforcement Learning(DRL)アプローチの実現可能性について検討する。
2Hzで動作するHigh-Level(HL)ポリシーは、生の8.4倍の84$ピクセルの単眼カメラフレーム、100倍の100$ピクセルの前方画像ソナー、空間的なサブゴールを生成するプロプリオセプティブデータを処理する。
10Hzで動作する低レベル(LL)ポリシーは、これらのサブゴールをスラスタコマンドに変換する。
論文 参考訳(メタデータ) (2026-06-07T08:34:29Z) - Sign Language Recognition using Parallel Bidirectional Reservoir Computing [0.2099922236065961]
本稿では,並列双方向貯水池計算(PBRC)とMediaPipeを組み合わせた手話認識システムを提案する。
MediaPipeは、PBRCアーキテクチャの入力機能として機能するハンドジョイント座標のリアルタイムハンドトラッキングと正確な抽出を可能にする。
我々は、Word-Level American Sign Language (WLASL)ビデオデータセットを用いてPBRCベースのSLRシステムをトレーニングし、それぞれ60.85%、85.86%、91.74%のトップ1、トップ5、トップ10のアキュラシーを達成した。
論文 参考訳(メタデータ) (2025-12-22T14:55:54Z) - Sign Language Recognition using Bidirectional Reservoir Computing [0.2099922236065961]
本稿では,MediaPipeとESNに基づく双方向貯水池アーキテクチャを用いた効率的な手話認識システムを提案する。
MediaPipeは手関節座標を抽出し、ESNベースのBRCアーキテクチャの入力として機能する。
BRCはこれらの機能を前方と後方の両方で処理し、時間的依存関係を効率的にキャプチャする。
論文 参考訳(メタデータ) (2025-11-30T08:25:27Z) - Large-Scale Model Enabled Semantic Communication Based on Robust Knowledge Distillation [45.347078403677216]
大規模モデル(LSM)は意味表現と理解に有効なフレームワークである。
しかしながら、それらの直接的なデプロイメントは、しばしば高い計算複雑性とリソース要求によって妨げられる。
本稿では,新しい知識蒸留に基づくセマンティックコミュニケーションフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-04T07:47:18Z) - R-Sparse: Rank-Aware Activation Sparsity for Efficient LLM Inference [77.47238561728459]
R-スパース(R-Sparse)は、高度なLCMにおいて高い疎度を達成できる訓練不要なアクティベーション・スパシティ・アプローチである。
10種類のタスクにわたるLlama-2/3およびMistralモデルの実験は、R-Sparseが50%のモデルレベルの間隔で同等のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2025-04-28T03:30:32Z) - MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization [49.00754561435518]
MSRSは、RS3ベンチマークで21.1%と0.9%のWERでVSRとAVSRの競争結果を達成し、トレーニング時間を少なくとも2倍に短縮した。
我々は、他のスパースアプローチを探索し、MSRSだけが、消失する勾配によって影響を受ける重量を暗黙的に隠蔽することで、スクラッチからトレーニングできることを示す。
論文 参考訳(メタデータ) (2024-06-25T15:00:43Z) - Unifying Synergies between Self-supervised Learning and Dynamic
Computation [53.66628188936682]
SSLとDCのパラダイム間の相互作用に関する新しい視点を提示する。
SSL設定において、スクラッチから高密度かつゲートされたサブネットワークを同時に学習することは可能であることを示す。
密集エンコーダとゲートエンコーダの事前学習における共進化は、良好な精度と効率のトレードオフをもたらす。
論文 参考訳(メタデータ) (2023-01-22T17:12:58Z) - Heterogeneous Reservoir Computing Models for Persian Speech Recognition [0.0]
Reservoir Computing Model (RC)モデルは、トレーニングに安価であること、パラメータが大幅に少なく、創発的なハードウェア技術と互換性があることが証明されている。
異なるスケールで時間的コンテキストをキャプチャする入力の非線形変換を生成するために、異種単層および多層ESNを提案する。
論文 参考訳(メタデータ) (2022-05-25T09:15:15Z) - Neural Model Reprogramming with Similarity Based Mapping for
Low-Resource Spoken Command Recognition [71.96870151495536]
低リソース音声コマンド認識(SCR)のための新しいAR手法を提案する。
ARプロシージャは、(対象領域から)音響信号を修正して、事前訓練されたSCRモデルを再利用することを目的としている。
提案したAR-SCRシステムについて,アラビア語,リトアニア語,マンダリン語を含む3つの低リソースSCRデータセットを用いて評価した。
論文 参考訳(メタデータ) (2021-10-08T05:07:35Z) - Reservoir-Based Distributed Machine Learning for Edge Operation [0.6451914896767135]
スマートセンサを組み込んだ機械学習アルゴリズムの現場学習のための新しい設計を紹介します。
無線周波数(RF)スペクトルセンサを用いた分散トレーニングシナリオについて述べる。
論文 参考訳(メタデータ) (2021-04-01T20:06:40Z) - Learning Centric Power Allocation for Edge Intelligence [84.16832516799289]
分散データを収集し、エッジで機械学習を実行するエッジインテリジェンスが提案されている。
本稿では,経験的分類誤差モデルに基づいて無線リソースを割り当てるLCPA法を提案する。
実験の結果,提案したLCPAアルゴリズムは,他のパワーアロケーションアルゴリズムよりも有意に優れていた。
論文 参考訳(メタデータ) (2020-07-21T07:02:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。