論文の概要: SignMAE: Segmentation-Driven Self-Supervised Learning for Sign Language Recognition
- arxiv url: http://arxiv.org/abs/2605.02094v1
- Date: Sun, 03 May 2026 23:25:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:50.077144
- Title: SignMAE: Segmentation-Driven Self-Supervised Learning for Sign Language Recognition
- Title(参考訳): SignMAE:手話認識のためのセグメンテーション駆動型自己教師付き学習
- Authors: Kunyuan Xie, Zhixi Cai, Kalin Stefanov,
- Abstract要約: 本稿では手話認識のための自己教師付き事前学習手法を提案する。
セグメンテーションベースのマスクを使用して、キーボディ部分の存在と動きに適応する。
WLASL、NMFs-CSL、Slovoでは、エンコーダは最先端の性能を達成する。
- 参考スコア(独自算出の注目度): 5.419344998705856
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Subtle hand differences make sign language recognition challenging, yet many existing methods rely on encoders pretrained on generic action datasets that poorly capture such fine-grained cues. We propose a self-supervised pretraining method for sign language recognition that uses segmentation-based masking to adapt to the presence and motion of key body parts, rather than treating hand poses as static visual tokens. The resulting mask-and-reconstruct objective improves fine-grained sign representation learning. On WLASL, NMFs-CSL, and Slovo, our encoder achieves state-of-the-art performance, improving per-instance and per-class Top-1 accuracy while using fewer input frames and modalities than comparable encoders.
- Abstract(参考訳): サブトルハンドの違いは手話認識を難しくするが、既存の多くのメソッドは、このようなきめ細かい操作をうまく捉えていないジェネリックアクションデータセットに事前訓練されたエンコーダに依存している。
本稿では,手ポーズを静的な視覚的トークンとして扱うのではなく,セグメンテーションに基づくマスキングを用いてキーボディ部分の存在と動きに適応する手話認識のための自己教師付き事前学習手法を提案する。
その結果、マスク・アンド・リコンストラクションの目的は、きめ細かい手話表現学習を改善する。
WLASL、NMFs-CSL、Slovoでは、同等のエンコーダよりも少ない入力フレームとモダリティを使用しながら、最先端の性能を実現し、インスタンスごとの精度とクラスごとのTop-1精度を向上させる。
関連論文リスト
- AutoSign: Direct Pose-to-Text Translation for Continuous Sign Language Recognition [0.0]
聴覚障害者コミュニティと聴覚障害者コミュニティのギャップを埋める上で,サインジェスチャを連続的に認識し,それらをグロースに変換することが重要な役割を担っている。
ポーズ列を直接自然言語テキストに変換する自動回帰デコーダのみの変換器であるAutoSignを提案する。
マルチステージパイプラインを削除することで、AutoSignはIsharah-1000データセットを大幅に改善した。
論文 参考訳(メタデータ) (2025-07-26T07:28:33Z) - Signs as Tokens: A Retrieval-Enhanced Multilingual Sign Language Generator [55.94334001112357]
テキスト入力から3Dサインアバターを自動回帰的に生成できる多言語手話モデルSigns as Tokens(SOKE)を導入する。
単語レベルの正確な記号を提供するために,外部記号辞書を組み込んだ検索強化SLG手法を提案する。
論文 参考訳(メタデータ) (2024-11-26T18:28:09Z) - Self-Supervised Representation Learning with Spatial-Temporal Consistency for Sign Language Recognition [96.62264528407863]
本研究では,空間的時間的整合性を通じてリッチな文脈を探索する自己教師付きコントラスト学習フレームワークを提案する。
動きと関節のモーダル性の相補性に着想を得て,手話モデルに一階動作情報を導入する。
提案手法は,4つの公開ベンチマークの広範な実験により評価され,新しい最先端性能と顕著なマージンを実現している。
論文 参考訳(メタデータ) (2024-06-15T04:50:19Z) - MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition [94.56755080185732]
本研究では,リッチモーションキューとグローバルセマンティック情報を統合したセマンティックアライメント(MASA)を用いたMotion-Awareマスク付きオートエンコーダを提案する。
我々のフレームワークは,包括的手話表現のための局所的な動きの手がかりとグローバルな意味的特徴を同時に学習することができる。
論文 参考訳(メタデータ) (2024-05-31T08:06:05Z) - Prefix Conditioning Unifies Language and Label Supervision [84.11127588805138]
学習した表現の一般化性を低減することにより,データセットのバイアスが事前学習に悪影響を及ぼすことを示す。
実験では、この単純な手法により、ゼロショット画像認識精度が向上し、画像レベルの分布シフトに対するロバスト性が向上することを示した。
論文 参考訳(メタデータ) (2022-06-02T16:12:26Z) - Skeleton Based Sign Language Recognition Using Whole-body Keypoints [71.97020373520922]
手話は聴覚障害者や言語障害者のコミュニケーションに使用される。
また,RGB-D法と組み合わせて最先端の性能を実現することで,Skeletonに基づく音声認識が普及しつつある。
近年のボディポーズ推定用citejin 2020wholeの開発に触発されて,全身キーポイントと特徴に基づく手話認識を提案する。
論文 参考訳(メタデータ) (2021-03-16T03:38:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。