論文の概要: SignRR: Retrieve and Refine Real Motion for Sign Language Production
- arxiv url: http://arxiv.org/abs/2608.28568v2
- Date: Tue, 01 Sep 2026 15:13:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.558054
- Title: SignRR: Retrieve and Refine Real Motion for Sign Language Production
- Title(参考訳): SignRR:手話生産のためのリアルモーションの検索とリファインダー化
- Authors: Fidel Omar Tito Cruz, Angie Sanchez Marquina, Summy Farfan, Gissella Bejarano,
- Abstract要約: 本稿では,実際の検索動作から始まり,それをグローバルなコヒーレントな署名シーケンスへと洗練するパラダイムであるrequire-and-refineを提案する。
我々のフレームワークであるSignRRは、実符号セグメントの辞書からの動作を初期化し、部分認識された残差VQ-VAEで全シーケンスを洗練する。
- 参考スコア(独自算出の注目度): 1.0332950685403934
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sign language production (SLP) aims to generate continuous signing motion from spoken language, often through gloss-to-pose generation. Prior work mainly follows two paradigms. Generative models synthesize motion from a learned prior or from noise, without reference to an observed signing instance, making rare hand configurations and signer-specific articulation difficult to preserve. Retrieval-based methods reuse real, well-articulated motion segments, but concatenating segments from different signers and co-articulation contexts can introduce rhythm and style inconsistencies across the full sequence, not only at segment boundaries. These limitations suggest a complementary solution: use retrieval to provide realistic articulation, and use learned refinement to impose the global coherence that retrieval alone lacks. We therefore propose retrieve-and-refine, a paradigm that starts from real retrieved motion and refines it into a globally coherent signing sequence rather than generating motion from scratch. Our framework, SignRR, initializes motion from a dictionary of real sign segments and refines the full sequence with a part-aware Residual VQ-VAE, where residual quantization preserves fine hand articulation and temporal length differences are handled in the latent space. Experiments on PHOENIX14T and CSL-Daily show that SignRR achieves state-of-the-art back-translation performance while maintaining competitive pose quality.
- Abstract(参考訳): 手話生成(SLP)は、しばしばグロス・ツー・プレイス・ジェネレーションを通じて、音声言語から連続的な署名動作を生成することを目的としている。
前作は主に2つのパラダイムを踏襲している。
生成モデルは、観測された署名インスタンスに言及せずに、学習した事前またはノイズから動きを合成し、稀な手の構成と手話の明瞭さを保存し難いものにする。
検索に基づく手法は, 実動セグメントを再利用するが, 異なるシグナと共動コンテキストからセグメントを結合することで, セグメント境界だけでなく, シーケンス全体のリズムやスタイルの不整合を生じさせる。
これらの制限は、現実的な調音を提供するために検索を使用すること、学習された洗練を利用して、検索だけで欠落するグローバルな一貫性を課すこと、という補完的な解決策を示唆している。
そこで本研究では,実際の検索動作から始まり,スクラッチから動作を生成するのではなく,グローバルコヒーレントな署名シーケンスへと洗練するパラダイムであるrequire-and-refineを提案する。
我々のフレームワークであるSignRRは、実符号セグメントの辞書からの動作を初期化し、残差量子化が細かな手調音を保存し、潜時空間で時間長差が処理される部分認識残差VQ-VAEで全シーケンスを洗練する。
PHOENIX14TとCSL-Dailyの実験は、SignRRが競合ポーズの品質を維持しつつ、最先端のバックトランスレーション性能を達成することを示した。
関連論文リスト
- Bridging the Gap Between Semantics and Reconstruction:Unifying Sign Language Translation and Production [16.56134410439223]
手話研究の最近の進歩は、複数の手話理解サブタスクを統合する傾向を示している。
言語理解と生産をひとつのフレームワークに統合することは可能か?
統合されたフレームワークは、2つの重要な課題に対処しなければならない。
論文 参考訳(メタデータ) (2026-08-10T02:50:07Z) - SignSparK: Efficient Multilingual Sign Language Production via Sparse Keyframe Learning [54.232148007248874]
現在の手話生産(SLP)フレームワークは、まさにトレードオフに直面している。
本研究では,スペースを利用した新たなトレーニングパラダイムを提案し,人間の署名の真の基盤となる分布を捉える。
これらの離散的なアンカーから高密度な動きを予測することにより、流体の調音を確実にしながら、回帰から平均への移動を緩和する。
論文 参考訳(メタデータ) (2026-03-11T06:02:36Z) - MIBURI: Towards Expressive Interactive Gesture Synthesis [62.45332399212876]
Embodied Conversational Agents (ECA) は、音声、ジェスチャー、表情を通じて人間の対面相互作用をエミュレートすることを目的としている。
既存のECAの解は、人間のような相互作用には適さない剛性で低多様性の運動を生み出す。
MIBURIは,リアルタイム音声対話と同期した表現力のあるフルボディジェスチャーと表情を生成するための,最初のオンライン因果的フレームワークである。
論文 参考訳(メタデータ) (2026-03-03T18:59:51Z) - AutoSign: Direct Pose-to-Text Translation for Continuous Sign Language Recognition [0.0]
聴覚障害者コミュニティと聴覚障害者コミュニティのギャップを埋める上で,サインジェスチャを連続的に認識し,それらをグロースに変換することが重要な役割を担っている。
ポーズ列を直接自然言語テキストに変換する自動回帰デコーダのみの変換器であるAutoSignを提案する。
マルチステージパイプラインを削除することで、AutoSignはIsharah-1000データセットを大幅に改善した。
論文 参考訳(メタデータ) (2025-07-26T07:28:33Z) - MS2SL: Multimodal Spoken Data-Driven Continuous Sign Language Production [93.32354378820648]
我々は,手話と非手話のユーザ間のコミュニケーションを緩和する,連続手話生成のための統一フレームワークを提案する。
テキストや音声から抽出した埋め込みを利用したシーケンス拡散モデルを作成し、段階的にサイン予測を生成する。
How2SignとPHOENIX14Tデータセットの実験により、手話生成において、我々のモデルが競合性能を達成することを示す。
論文 参考訳(メタデータ) (2024-07-04T13:53:50Z) - MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition [94.56755080185732]
本研究では,リッチモーションキューとグローバルセマンティック情報を統合したセマンティックアライメント(MASA)を用いたMotion-Awareマスク付きオートエンコーダを提案する。
我々のフレームワークは,包括的手話表現のための局所的な動きの手がかりとグローバルな意味的特徴を同時に学習することができる。
論文 参考訳(メタデータ) (2024-05-31T08:06:05Z) - Signing at Scale: Learning to Co-Articulate Signs for Large-Scale
Photo-Realistic Sign Language Production [43.45785951443149]
手話は視覚言語であり、語彙は話し言葉と同じくらい豊かである。
現在の深層学習に基づく手話生成(SLP)モデルでは、アンダーアーティキュレートされたスケルトンポーズシーケンスが生成される。
我々は,辞書記号間の協調処理を学習することで,大規模SLPに取り組む。
また,ポーズ条件付き人間の合成モデルであるSignGANを提案する。
論文 参考訳(メタデータ) (2022-03-29T08:51:38Z) - Pose-based Sign Language Recognition using GCN and BERT [0.0]
単語レベルの手話認識(WSLR)は手話を理解し解釈するための最初の重要なステップである。
ビデオからサインを認識することは、単語の意味が微妙な身体の動き、手の動き、その他の動きの組み合わせに依存するため、難しい作業である。
W SLRの最近のポーズベースアーキテクチャは、異なるフレーム内のポーズ間の空間的および時間的依存関係を同時にモデル化するか、空間的情報を完全に活用せずに時間的情報のみをモデル化する。
本稿では,空間的・時間的情報を別々に捉え,遅延融合を行う新しいポーズベースアプローチを用いて,W SLRの課題に取り組む。
論文 参考訳(メタデータ) (2020-12-01T19:10:50Z) - Video-based Sign Language Recognition without Temporal Segmentation [88.03159640595187]
本稿では,時間分割の事前処理を不要とする新しい連続符号認識フレームワークを提案する。
提案するLS-HANは,映像特徴表現生成のための2ストリーム畳み込みニューラルネットワーク(CNN),意味ギャップブリッジのための潜時空間,潜在空間に基づく認識のための階層的注意ネットワーク(HAN)の3つのコンポーネントから構成される。
論文 参考訳(メタデータ) (2018-01-30T17:37:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。