論文の概要: Toward Deployable Bangla Sign Language Recognition with Expert-Validated Data and a Lightweight Attention-Based Model
- arxiv url: http://arxiv.org/abs/2608.06252v1
- Date: Thu, 06 Aug 2026 16:41:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.965062
- Title: Toward Deployable Bangla Sign Language Recognition with Expert-Validated Data and a Lightweight Attention-Based Model
- Title(参考訳): エキスパートバリデードデータと軽量注意モデルを用いたバングラ手話認識の実現に向けて
- Abstract要約: RSBdSL38,10,874名の専門家による検証画像が38個のBdSLハンドサインにまたがって紹介される。
本稿では298,470個のパラメータからなる軽量な注意に基づく畳み込みネットワークを提案する。
96.37%の精度(95.72% +-0.54%の5つの種子)を達成し、9つのImageNet事前規制された効率的なアーキテクチャのうち、1.08ポイント以内である。
- 参考スコア(独自算出の注目度): 0.14323566945483496
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deaf and hard-of-hearing people in Bangladesh communicate mainly through Bangla Sign Language (BdSL). Automatic BdSL recognition on personal devices could widen access to education and services. Existing systems use controlled-setting datasets without expert verification and heavyweight pretrained backbones unsuited to on-device use. We introduce RSBdSL38, 10,874 expert-validated images spanning all 38 BdSL hand signs, representing the 51 letters of the Bangla alphabet, recorded from real signers at three special-needs schools across Bangladesh. We propose a lightweight attention based convolutional network of 298,470 parameters, built from grouped bottleneck residual blocks, channel and spatial attention, a multi-scale depthwise hand-feature block, dual pooling, and Swish activations. Trained from scratch, it attains 96.37% accuracy (95.72% +- 0.54% over five seeds), within 1.08 percentage points of the best of nine ImageNet-pretrained efficient architectures under an identical protocol, using 8.5 to 68x fewer parameters and 1.3 to 21.7x fewer MACs. Retrained, it reaches 92.95 to 98.33% on six public BdSL benchmarks, 97.04% on a merged corpus, and 76.25% zero-shot on BdSL-38. Removing any architectural stage costs 7.61 to 89.30 points, against at most 3.17 for the training recipe. Grad-CAM with deletion-insertion and weight-randomization checks confirms that predictions follow the signing hand. A signer-independent split holding out 6 of 36 signers yields 85.18%. Quantized to 0.48 MB, it runs at 3.98 ms per image within a 15.5 MB footprint on a commodity smartphone. Together, RSBdSL38 and our from-scratch model turn benchmark accuracy into deployable accessibility at a fraction of pretrained-backbone cost; dataset, code, and models are released.
- Abstract(参考訳): バングラデシュの聴覚障害者や難聴者は主にバングラ手話(BdSL)を通してコミュニケーションしている。
パーソナルデバイス上でのBdSLの自動認識は、教育やサービスへのアクセスを拡大する可能性がある。
既存のシステムは、専門家の検証なしに制御されたデータセットを使用し、デバイス上での使用には適さない重い事前訓練されたバックボーンを使用する。
バングラデシュの3つの特別支援学校において,実署名者から記録された,38のBdSL文字の51文字を表現したRSBdSL38,10,874のエキスパート検証画像を紹介した。
本稿では,グループ化されたボトルネック残差ブロック,チャネルと空間の注意,多スケールの深度手形ブロック,二重プール,スウィッシュアクティベーションから構築された298,470個のパラメータからなる軽量な注意に基づく畳み込みネットワークを提案する。
スクラッチからトレーニングし、96.37%の精度(95.72% +-0.54%の5つの種子)を獲得し、8.5から68倍のパラメータと1.3から21.7倍のMACを使用して、9つのImageNet事前訓練された効率的なアーキテクチャのうち、1.08ポイント以内である。
6つのBdSLベンチマークで92.95から98.33%、合併したコーパスで97.04%、BdSL-38で76.25%に達する。
あらゆる建築段階の廃止には7.61から89.30ポイントの費用がかかるが、トレーニングレシピは少なくとも3.17ポイントの費用がかかる。
減量と重量ランダム化チェックを備えたGrad-CAMは、予測が署名の手に従うことを確認します。
36のシグナーのうち6つを保持するシグナー非依存のスプリットは85.18%を得る。
0.48MBに量子化され、コモディティスマートフォンの15.5MBのフットプリント内、画像あたり3.98msで動作する。
RSBdSL38と私たちのオフスクラッチモデルとともに、ベンチマークの精度を事前トレーニングされたバックボーンコストのごく一部でデプロイ可能なアクセシビリティに変換し、データセット、コード、モデルがリリースされます。
関連論文リスト
- AgroVisNet: A lightweight Convolutional Network and the BD-PlantDX Expert-Validated Benchmark for Radish, Potato and Pointed Gourd Disease Classification [0.3686530147760243]
我々は,BD-PlantDXとともに,スクラッチから学習したコンパクトな畳み込みネットワークであるAgroVisNetを提案する。
BD-PlantDXでは、テスト精度は99.52%、重み付きF1は99.52%に達し、6つのImageNet推奨の軽量バックボーンを超える。
デプロイ用にエクスポートされたこのモデルは、0.46MBのフル整数ネットワークに0.22ポイントの精度で量子化し、1CPUで8.40msの画像を分類する。
論文 参考訳(メタデータ) (2026-09-09T17:12:17Z) - BarkNet-Lite: A Lightweight Texture and Colour Network with the BarkBD Benchmark for Bark-Based Tree Species Recognition in Bangladesh [0.40272693479079796]
バングラデシュのバークデータセットであるBarkBDをリリースしています。
ランダム初期化から学習した2.96MパラメータネットワークBarkNet-Liteを提案する。
我々は,コモディティスマートフォン上で1枚の写真を15.34ミリ秒で分類する単一精度モデルを輸出する。
論文 参考訳(メタデータ) (2026-09-07T15:10:48Z) - Robust Assamese Speech Recognition through Controlled Fine-Tuning of Whisper Models [1.4095958360608893]
本稿ではMozilla Common Voice 24.0-Assamese corpusで学習したWhisper-based Assamese ASRシステムについて述べる。
ハードウェア対応の最適化トレーニングパイプラインは、リソース制約のある環境向けに実装されている。
論文 参考訳(メタデータ) (2026-07-19T09:54:52Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - TinySSL: Distilled Self-Supervised Pretraining for Sub-Megabyte MCU Models [0.14504054468850666]
自己教師付き学習(SSL)は、大規模モデルの表現学習を変換しているが、500K未満のパラメータを持つマイクロコントローラ(MCU)クラスモデルでは探索されていない。
本稿では,教師指導型フレームワークであるCA-DSSL(Capacity-Aware Distilled Self-Supervised Learning)を提案する。
予備的な ImageNet-100 実験により、CA-DSSL の利点は小さなデータレシエーションに特有であることが判明した。
論文 参考訳(メタデータ) (2026-05-07T07:51:00Z) - EfficientSign: An Attention-Enhanced Lightweight Architecture for Indian Sign Language Recognition [3.4772255133148366]
我々は、EfficientNet-B0を採用し、2つの注目モジュールに焦点を当てた軽量モデルを構築します。
インド手話アルファベットの12,637の画像を、他の5つのアプローチと比較した。
論文 参考訳(メタデータ) (2026-04-09T18:27:57Z) - Fine-Tuning Video Transformers for Word-Level Bangla Sign Language: A Comparative Analysis for Classification Tasks [1.633119622546771]
手話認識には、画像やビデオから手話の自動識別と分類が含まれる。
バングラデシュでは、バングラ手話は聴覚障害を持つ多くの人々のコミュニケーションの主要な手段である。
そこで本研究では,小規模BdSLデータセット上での最先端のビデオトランスフォーマーアーキテクチャについて述べる。
論文 参考訳(メタデータ) (2025-06-04T18:29:32Z) - BAUST Lipi: A BdSL Dataset with Deep Learning Based Bangla Sign Language Recognition [0.5497663232622964]
聴覚障害者コミュニティとのコミュニケーションを強化するために、手話の研究が盛んである。
重要な障壁の1つは、包括的なBangla手話データセットがないことである。
18,000個の画像からなる新しいBdSLデータセットを導入し,各画像のサイズを224×224ピクセルとする。
我々は、複数の畳み込み層、アクティベーション機能、ドロップアウト技術、LSTM層を統合するハイブリッド畳み込みニューラルネットワーク(CNN)モデルを考案した。
論文 参考訳(メタデータ) (2024-08-20T03:35:42Z) - Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone [289.9290405258526]
我々は3.3兆のトークンでトレーニングされた38億のパラメータ言語モデルであるphi-3-miniを紹介する。
MMLUでは69%、MTベンチでは8.38である。
本稿では, phi-3.5-mini, phi-3.5-MoE, phi-3.5-Visionの3モデルを紹介する。
論文 参考訳(メタデータ) (2024-04-22T14:32:33Z) - Patch-Level Contrasting without Patch Correspondence for Accurate and
Dense Contrastive Representation Learning [79.43940012723539]
ADCLRは、正確で高密度な視覚表現を学習するための自己教師型学習フレームワークである。
提案手法は, コントラッシブな手法のための新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2023-06-23T07:38:09Z) - Alexa Teacher Model: Pretraining and Distilling Multi-Billion-Parameter
Encoders for Natural Language Understanding Systems [63.713297451300086]
本研究では,700Mから9.3Bまでの非埋め込みパラメータ数を持つ事前学習エンコーダの大規模実験結果について述べる。
その後、17M-170Mパラメータからより小さなモデルに蒸留し、仮想アシスタントシステムの自然言語理解(NLU)コンポーネントに応用した。
論文 参考訳(メタデータ) (2022-06-15T20:44:23Z) - DeBERTa: Decoding-enhanced BERT with Disentangled Attention [119.77305080520718]
2つの新しい手法を用いてBERTモデルとRoBERTaモデルを改善する新しいモデルアーキテクチャDeBERTaを提案する。
これらの手法により,モデル事前学習の効率化と,自然言語理解(NLU)と自然言語生成(NLG)の両方の性能向上が期待できる。
論文 参考訳(メタデータ) (2020-06-05T19:54:34Z) - Improving Efficiency in Large-Scale Decentralized Distributed Training [58.80224380923698]
通信コストを最小化しつつ、スペクトルギャップを改善して(A)D-PSGDに基づくトレーニングを加速する手法を提案する。
提案手法の有効性を示すために,2000時間Switchboard音声認識タスクとImageNetコンピュータビジョンタスクの実験を行った。
論文 参考訳(メタデータ) (2020-02-04T04:29:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。