論文の概要: The In-Car Sign Language Corpus (ICSL): A Multi-Modal Resource for Constrained-Space Sign Language Recognition
- arxiv url: http://arxiv.org/abs/2607.11341v1
- Date: Mon, 13 Jul 2026 10:03:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.422364
- Title: The In-Car Sign Language Corpus (ICSL): A Multi-Modal Resource for Constrained-Space Sign Language Recognition
- Title(参考訳): 車載手話コーパス(ICSL:Constrained-Space手話認識のためのマルチモーダルリソース)
- Authors: Raviteja Boddu, Guilherme Vieira Leite, Joed Lopes da Silva, Ângelo Benetti, Isabela Barbieri, Natália de Melo Afonso, Thyago Santos, Helio Pedrini, Felipe Venâncio Barbosa, José Mario De Martino, Munir Georges, Alessandro Zimmer,
- Abstract要約: In-Car Sign Language (ICSL) dataset for Brazil Sign Language (Libras)
In-Car Sign Language (ICSL) dataset for Brazil Sign Language (Libras)
- 参考スコア(独自算出の注目度): 32.52475813485339
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper addresses the challenges of using sign language within shared mobility services, such as taxis, carpools, or ride-sharing platforms. The use of sign language recognition (SLR) in real-world, confined environments, specifically vehicle interiors remains largely unexplored. To motivate research in this area, we present the In-Car Sign Language (ICSL) dataset for Brazilian Sign Language (Libras), with the long-term goal of improving public transport accessibility for the Deaf and Hard-of-Hearing community. The dataset consists of: (1) high-precision laboratory motion capture (MoCap) data to establish an idealized linguistic baseline and (2) real-world multi-modal in-car recordings captured using a 2D camera and 3D Time-of-Flight sensors. The dataset provides a basis for comparative analyses between synthesized signing avatar animations and recorded real signing interpreter videos, which enable future research into robust "in-the-wild" SLR models and domain adaptation. We describe in detail the use cases, the setup, the data collection protocol, and the metadata structure of the corpus. In total, we recorded a multimodal dataset exceeding 1.5 million frames, comprising the synchronized multimodal streams described above featuring Libras users across various in-car scenarios. The corpus is provided with gloss annotation of lexical signs and non-lexical sign language elements specially designed to support the training and evaluation of deep neural networks for constrained space recognition. In-vehicle signing offers a technically significant example of a constrained, occluded, and non-frontal environment. While recognizing the diverse communication strategies already employed by the Deaf community, identifying automotive-specific limitations provides a useful stepping stone for research into enhancing in-car accessibility and passenger quality of life.
- Abstract(参考訳): 本稿では,タクシーやカープール,ライドシェアリングプラットフォームなど,共有モビリティサービスにおいて手話を使用する上での課題に対処する。
実環境、特に車内における手話認識(SLR)の使用は、未調査のままである。
この分野での研究を動機づけるため,ブラジル手話(リバス)のための車内手話(ICSL)データセットを提示する。
このデータセットは,(1) 理想的な言語ベースラインを確立するための高精度な実験室モーションキャプチャ(MoCap)データと,(2) 実世界のマルチモーダル車内記録を2Dカメラと3D Time-of-Flightセンサーで取得する。
このデータセットは、合成された署名アバターアニメーションと記録された実際の署名インタプリタビデオの比較分析の基盤を提供する。
本稿では,ユースケース,セットアップ,データ収集プロトコル,コーパスのメタデータ構造について詳述する。
合計150万フレームを超えるマルチモーダルデータセットを記録し、上述した同期マルチモーダルストリームから、車内シナリオにまたがるLibrasユーザを特徴付ける。
本発明のコーパスは、制約された空間認識のためのディープニューラルネットワークのトレーニング及び評価を支援するために特別に設計された、語彙記号の光沢アノテーションと非語彙手話要素とを備える。
車両内署名は、技術的に重要な、制約のある、隠蔽された、非フロント環境の例である。
ディーフコミュニティが既に採用している多様なコミュニケーション戦略を認識しながら、自動車特有の制限を特定することは、車内アクセシビリティと乗客の生活の質を高める研究に役立つ。
関連論文リスト
- Isolated Sign Language Recognition with Segmentation and Pose Estimation [0.0]
独立した手話認識は、大きな言語モデルとAmerican Sign Language (ASL)ユーザの間のギャップを埋める可能性がある。
我々は,シグナ変動に対するロバスト性を維持しつつ,計算要求を低減できるISLRのモデルを提案する。
論文 参考訳(メタデータ) (2025-12-16T19:44:12Z) - Lost in Translation, Found in Embeddings: Sign Language Translation and Alignment [84.39962912136525]
我々は手話翻訳(SLT)と手話字幕アライメント(SSA)を実行する手話理解モデルを開発する。
i)人間のキーポイントと唇領域の画像から手動と非手動のキューをキャプチャする軽量な視覚バックボーン,(ii)連続的な視覚特徴を単語レベルの埋め込みに集約するスライディングパーシーバーマッピングネットワーク,(iii)SLTとSSAを協調的に最適化するマルチタスクスケーラブルなトレーニング戦略である。
論文 参考訳(メタデータ) (2025-12-08T21:05:46Z) - SCOPE: Sign Language Contextual Processing with Embedding from LLMs [49.5629738637893]
世界中の約7000万人の聴覚障害者が使用する手話は、視覚的および文脈的な情報を伝える視覚言語である。
視覚に基づく手話認識(SLR)と翻訳(SLT)の現在の手法は、限られたデータセットの多様性と文脈に関連のある情報の無視により、対話シーンに苦慮している。
SCOPEは、コンテキスト認識型ビジョンベースSLRおよびSLTフレームワークである。
論文 参考訳(メタデータ) (2024-09-02T08:56:12Z) - MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition [94.56755080185732]
本研究では,リッチモーションキューとグローバルセマンティック情報を統合したセマンティックアライメント(MASA)を用いたMotion-Awareマスク付きオートエンコーダを提案する。
我々のフレームワークは,包括的手話表現のための局所的な動きの手がかりとグローバルな意味的特徴を同時に学習することができる。
論文 参考訳(メタデータ) (2024-05-31T08:06:05Z) - Enhancing Brazilian Sign Language Recognition through Skeleton Image Representation [2.6311088262657907]
本研究は、身体、手、顔のランドマークを時間を通して抽出し、2次元画像として符号化する、分離手話認識(ISLR)アプローチを提案する。
ブラジル手話(LIBRAS)における2つの広く認識されているデータセットの性能指標から,本手法が最先端の指標を上回ったことを示す。
より正確であることに加えて、より単純なネットワークアーキテクチャに依存し、入力としてのみRGBデータに依存するため、我々の手法はより時間効率が高く、訓練が容易である。
論文 参考訳(メタデータ) (2024-04-29T23:21:17Z) - Sign Language Recognition via Skeleton-Aware Multi-Model Ensemble [71.97020373520922]
手話は一般的に、聴覚障害者やミュート人がコミュニケーションするために使われる。
孤立手話認識(SLR)のためのGlobal Ensemble Model(GEM)を用いた新しいマルチモーダルフレームワークを提案する。
提案するSAM-SLR-v2 フレームワークは極めて有効であり,最先端の性能を高いマージンで達成している。
論文 参考訳(メタデータ) (2021-10-12T16:57:18Z) - Multi-Modal Zero-Shot Sign Language Recognition [51.07720650677784]
マルチモーダルなゼロショット手話認識モデルを提案する。
C3DモデルとともにTransformerベースのモデルを使用して手の検出と深い特徴抽出を行う。
意味空間は、視覚的特徴をクラスラベルの言語的な埋め込みにマッピングするために使用される。
論文 参考訳(メタデータ) (2021-09-02T09:10:39Z) - Pose-based Sign Language Recognition using GCN and BERT [0.0]
単語レベルの手話認識(WSLR)は手話を理解し解釈するための最初の重要なステップである。
ビデオからサインを認識することは、単語の意味が微妙な身体の動き、手の動き、その他の動きの組み合わせに依存するため、難しい作業である。
W SLRの最近のポーズベースアーキテクチャは、異なるフレーム内のポーズ間の空間的および時間的依存関係を同時にモデル化するか、空間的情報を完全に活用せずに時間的情報のみをモデル化する。
本稿では,空間的・時間的情報を別々に捉え,遅延融合を行う新しいポーズベースアプローチを用いて,W SLRの課題に取り組む。
論文 参考訳(メタデータ) (2020-12-01T19:10:50Z) - How2Sign: A Large-scale Multimodal Dataset for Continuous American Sign
Language [37.578776156503906]
How2Signは、マルチモーダルかつマルチビューの連続した米国手話(ASL)データセットである。
80時間以上の手話ビデオの並列コーパスと、音声、英語の書き起こし、深さなどに対応する一連のモダリティから構成される。
3時間のサブセットがパノプティカル・スタジオで記録され、詳細な3Dポーズ推定が可能となった。
論文 参考訳(メタデータ) (2020-08-18T20:22:16Z) - Video-based Sign Language Recognition without Temporal Segmentation [88.03159640595187]
本稿では,時間分割の事前処理を不要とする新しい連続符号認識フレームワークを提案する。
提案するLS-HANは,映像特徴表現生成のための2ストリーム畳み込みニューラルネットワーク(CNN),意味ギャップブリッジのための潜時空間,潜在空間に基づく認識のための階層的注意ネットワーク(HAN)の3つのコンポーネントから構成される。
論文 参考訳(メタデータ) (2018-01-30T17:37:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。