論文の概要: Kinematics-Centric Continuous Sign Language Retrieval with Gloss-Guided Boundary-Aware Alignment
- arxiv url: http://arxiv.org/abs/2610.05306v1
- Date: Sun, 04 Oct 2026 15:28:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 21:46:24.197969
- Title: Kinematics-Centric Continuous Sign Language Retrieval with Gloss-Guided Boundary-Aware Alignment
- Title(参考訳): グロスガイド付き境界認識アライメントを用いたキネマティクス中心の連続手話検索
- Abstract要約: 本稿では,3次元SMPL-X運動を主表現とするキネマティクス中心のフレームワークを提案する。
手話の構成特性を捉えるため,光沢誘導型局所アライメント機構を導入する。
標準ベンチマーク実験により,本手法が最先端の双方向検索性能を実現することを示す。
- 参考スコア(独自算出の注目度): 57.69070973373309
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sign language-text alignment remains a fundamental challenge for text-driven sign language understanding. Existing methods predominantly rely on appearance-heavy RGB representations, which entangle motion semantics with visual variations and lead to ambiguous motion-language grounding. In this paper, we reformulate sign language-text alignment in a structured kinematic space and propose a kinematics-centric framework that adopts 3D SMPL-X motion as the primary representation. By explicitly modeling the kinematic dynamics of signing in a unified motion space, our approach reduces reliance on appearance signals and yields more semantically consistent representations. To capture the compositional nature of sign language, we introduce a gloss-guided local alignment mechanism that leverages gloss temporal spans as weak supervision to decompose continuous motion into coherent segments and establish fine-grained motion-text correspondences, thereby reducing ambiguity in localizing word-level semantics in continuous signing. Furthermore, we develop a visual distillation strategy, where RGB signals serve as privileged supervision during training to provide complementary contextual cues, while being completely removed at inference time. Extensive experiments on standard benchmarks demonstrate that our method achieves state-of-the-art bidirectional retrieval performance on CSL-Daily and competitive results on PHOENIX-2014T. These results highlight the effectiveness of kinematic representations and explicit local grounding for sign language-text alignment.
- Abstract(参考訳): 手話テキストのアライメントは、テキスト駆動手話理解の基本的な課題である。
既存の手法は主に外見に富んだRGB表現に依存しており、動きのセマンティクスは視覚的変化と絡み合い、あいまいな動きの接地につながる。
本稿では,3次元SMPL-X運動を主表現とする手話テキストアライメントを構造化されたキネマティック空間で再構成し,キネマティックス中心のフレームワークを提案する。
統一運動空間における署名の運動力学を明示的にモデル化することにより、我々の手法は外観信号への依存を減らし、より意味論的に一貫した表現をもたらす。
手話の構成的性質を捉えるため,光沢時間的スパンを弱い監督力として活用し,連続的な動きをコヒーレントなセグメントに分解し,微粒な動き-テキスト対応を確立することにより,連続署名における単語レベルのセマンティクスの局所化における曖昧さを低減させる,光沢誘導型局所アライメント機構を導入する。
さらに,RGB信号が学習中に特権的監督として機能し,コンテクストを補完し,推論時に完全に除去される視覚蒸留戦略を開発した。
CSL-DailyとPHOENIX-2014Tの競合実験により,本手法がCSL-Dailyにおける最先端の双方向検索性能を実現することを示す。
これらの結果は,手話テキストアライメントにおけるキネマティック表現と明示的局所グラウンドリングの有効性を強調した。
関連論文リスト
- Fine-grained Motion Retrieval via Joint-Angle Motion Images and Token-Patch Late Interaction [8.282478908772534]
テキストモーション検索は、自然言語記述と3次元人間の骨格配列の間の意味的に整合した潜在空間を学習することを目的としている。
既存のほとんどのメソッドは、モーションとテキストをグローバルな埋め込みに圧縮するデュアルエンコーダフレームワークを使用している。
本稿では,関節の局所的な特徴を擬似画像にマッピングする,解釈可能な,関節角度に基づく動作表現を提案する。
論文 参考訳(メタデータ) (2026-03-10T17:26:42Z) - Beyond Global Alignment: Fine-Grained Motion-Language Retrieval via Pyramidal Shapley-Taylor Learning [56.6025512458557]
動き言語検索は、自然言語と人間の動きの間の意味的ギャップを埋めることを目的としている。
既存のアプローチは主に、全動作シーケンスとグローバルテキスト表現の整合性に重点を置いている。
本研究では,微粒な動き言語検索のためのPST学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T16:00:12Z) - Sign Spotting Disambiguation using Large Language Models [29.79050316749927]
本稿では,Large Language Models(LLMs)を統合して,符号スポッティング品質を大幅に向上させる,学習自由フレームワークを提案する。
提案手法は,グローバル・テンポラル・ハンド形状の特徴を抽出し,その特徴を大規模手話辞書と照合する。
この辞書ベースのマッチングは本質的に、モデルの再訓練を必要とせず、より優れた語彙の柔軟性を提供する。
論文 参考訳(メタデータ) (2025-07-04T16:38:09Z) - Self-Supervised Representation Learning with Spatial-Temporal Consistency for Sign Language Recognition [96.62264528407863]
本研究では,空間的時間的整合性を通じてリッチな文脈を探索する自己教師付きコントラスト学習フレームワークを提案する。
動きと関節のモーダル性の相補性に着想を得て,手話モデルに一階動作情報を導入する。
提案手法は,4つの公開ベンチマークの広範な実験により評価され,新しい最先端性能と顕著なマージンを実現している。
論文 参考訳(メタデータ) (2024-06-15T04:50:19Z) - MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition [94.56755080185732]
本研究では,リッチモーションキューとグローバルセマンティック情報を統合したセマンティックアライメント(MASA)を用いたMotion-Awareマスク付きオートエンコーダを提案する。
我々のフレームワークは,包括的手話表現のための局所的な動きの手がかりとグローバルな意味的特徴を同時に学習することができる。
論文 参考訳(メタデータ) (2024-05-31T08:06:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。