論文の概要: Q-BridgeNet: A Quantization Network for Cross-Lingual Sign Language Translation
- arxiv url: http://arxiv.org/abs/2607.11215v1
- Date: Mon, 13 Jul 2026 08:09:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.388168
- Title: Q-BridgeNet: A Quantization Network for Cross-Lingual Sign Language Translation
- Title(参考訳): Q-BridgeNet: 言語間手話翻訳のための量子化ネットワーク
- Abstract要約: 多言語手話翻訳(SLT)のための統合フレームワークQ-BridgeNetを提案する。
符号言語側では、Q-BridgeNetは適応セグメンテーションと残留ベクトル量子化によって離散Qユニットを学習する。
音声言語側では、多言語 LLM を細調整して Q-unit 空間で動作させ、言語間先行を活用できる。
- 参考スコア(独自算出の注目度): 32.8621437737264
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most sign language translation (SLT) methods focus on isolated native sign-spoken pairs (e.g., American Sign Language - English). Extending language-specific SLT models to multilingual translation would improve accessibility by enabling communication across diverse sign and spoken language communities. However, existing multilingual SLT approaches still struggle to learn a unified model that minimizes cross-lingual conflicts while capturing shared cross-lingual semantics and preserving language-specific variations across different sign languages. Therefore, we propose Q-BridgeNet, a unified framework for multilingual SLT that jointly mitigates cross-lingual conflicts across both the sign language and spoken language sides. On the sign language side, Q-BridgeNet learns discrete Q-units via adaptive segmentation and residual vector quantization: a shared base codebook provides language-agnostic semantic primitives, while language-specific residual codebooks refine heterogeneous signing semantics. On the spoken language side, a multilingual LLM is fine-tuned to operate in the Q-unit space, leveraging cross-lingual priors to enable a unified SLT model. Experiments on PHOENIX14T, How2Sign, and CSL-Daily show that Q-BridgeNet effectively mitigates cross-lingual conflicts, achieving state-of-the-art performance on native sign-spoken pairs while also demonstrating strong generalization to non-native pairs. Our source code is publicly available at: https://github.com/FengLiQ/Q-BridgeNet
- Abstract(参考訳): ほとんどの手話翻訳(SLT)手法は、孤立した手話対(例えば、アメリカ手話 - 英語)に焦点を当てている。
言語固有のSLTモデルを多言語翻訳に拡張することで、多様な手話や音声言語コミュニティ間のコミュニケーションを可能にすることで、アクセシビリティを向上させることができる。
しかし、既存の多言語SLTアプローチは、共通言語間セマンティクスを捕捉し、異なる手話言語間で言語固有のバリエーションを保持する一方で、言語間紛争を最小限に抑える統一モデルを学ぶのに依然として苦労している。
そこで本研究では,多言語SLTのための統合フレームワークであるQ-BridgeNetを提案する。
共有ベースコードブックは言語に依存しないセマンティックプリミティブを提供し、言語固有の残留コードブックは異種セマンティクスを洗練させる。
音声言語側では、多言語 LLM を細調整して Q-unit 空間で動作させ、言語間先行を活用して統一SLTモデルを実現する。
PHOENIX14T、How2Sign、CSL-Dailyの実験では、Q-BridgeNetは言語間の競合を効果的に軽減し、ネイティブのサインスポークペア上で最先端のパフォーマンスを達成すると同時に、非ネイティブペアへの強力な一般化を示す。
私たちのソースコードは、https://github.com/FengLiQ/Q-BridgeNetで公開されています。
関連論文リスト
- Evaluating Multilingual and Code-Switched Alignment in LLMs via Synthetic Natural Language Inference [2.172419551358714]
大規模言語モデル(LLM)は多言語的文脈においてますます適用されているが、言語間で一貫した論理的に根ざしたアライメントの能力は未定である。
本稿では、論理に基づく前提-仮説ペアを生成する多言語自然言語推論のフレームワークを提案し、それらを類型的に多様な言語に翻訳する。
コードスイッチングは劣化せず、性能も向上し、翻訳によって引き起こされる語彙の変化が正規化信号として機能することを示唆している。
論文 参考訳(メタデータ) (2025-08-20T14:30:34Z) - Multilingual Gloss-free Sign Language Translation: Towards Building a Sign Language Foundation Model [3.838572376072069]
手話翻訳は、手話(SL)ビデオを音声言語テキストに変換することを目的としている。
トークンレベルのSL識別と音声テキスト生成のための2つのCTC目的を持つ多言語グロスフリーモデルを提案する。
我々のモデルは10のSLをサポートし、1対1、多対1、多対多のSLTタスクを処理する。
論文 参考訳(メタデータ) (2025-05-30T08:47:44Z) - Simple yet Effective Code-Switching Language Identification with
Multitask Pre-Training and Transfer Learning [0.7242530499990028]
コードスイッチング(Code-switching)は、カジュアルな設定において、多言語話者が異なる言語の単語を1つの発話で混ぜる言語現象である。
英マンダリン言語指向音声データセットにおける言語識別精度向上のための2つの新しいアプローチを提案する。
我々の最良のモデルでは、実際の英マンダリンのコードスイッチングによる子指向音声コーパスにおいて、0.781のバランスの取れた精度を達成し、以前のベースラインを55.3%上回っている。
論文 参考訳(メタデータ) (2023-05-31T11:43:16Z) - VECO 2.0: Cross-lingual Language Model Pre-training with
Multi-granularity Contrastive Learning [56.47303426167584]
複数粒度アライメントを持つコントラスト学習に基づく言語間事前学習モデルVECO2.0を提案する。
具体的には、シーケンス・ツー・シーケンスアライメントが誘導され、並列対の類似性を最大化し、非並列対を最小化する。
トークン・ツー・トークンのアライメントは、シソーラス辞書を介して発掘された同義トークンと、バイリンガルな例の他の未使用トークンとのギャップを埋めるために統合される。
論文 参考訳(メタデータ) (2023-04-17T12:23:41Z) - LAE: Language-Aware Encoder for Monolingual and Multilingual ASR [87.74794847245536]
言語固有の情報を混在させることにより,両状況に対処する新しい言語対応エンコーダ (LAE) アーキテクチャを提案する。
マンダリン・イングリッシュ・コードスウィッチ音声を用いた実験により,LAEはフレームレベルで異なる言語を識別できることが示唆された。
論文 参考訳(メタデータ) (2022-06-05T04:03:12Z) - Multi-level Contrastive Learning for Cross-lingual Spoken Language
Understanding [90.87454350016121]
コントラスト学習のための難解なサンプルを, あらゆるレベルで生成するコードスイッチング手法を開発した。
言語間知識伝達にラベルセマンティクスを利用するラベル認識ジョイントモデルを開発した。
論文 参考訳(メタデータ) (2022-05-07T13:44:28Z) - Discovering Representation Sprachbund For Multilingual Pre-Training [139.05668687865688]
多言語事前学習モデルから言語表現を生成し、言語分析を行う。
すべての対象言語を複数のグループにクラスタリングし、表現のスプラックバンドとして各グループに名前を付ける。
言語間ベンチマークで実験を行い、強いベースラインと比較して大幅な改善が達成された。
論文 参考訳(メタデータ) (2021-09-01T09:32:06Z) - VECO: Variable and Flexible Cross-lingual Pre-training for Language
Understanding and Generation [77.82373082024934]
我々はTransformerエンコーダにクロスアテンションモジュールを挿入し、言語間の相互依存を明確に構築する。
独自の言語でコンテキストにのみ条件付けされたマスク付き単語の予測の退化を効果的に回避することができる。
提案した言語間モデルでは,XTREMEベンチマークのさまざまな言語間理解タスクに対して,最先端の新たな結果が提供される。
論文 参考訳(メタデータ) (2020-10-30T03:41:38Z) - FILTER: An Enhanced Fusion Method for Cross-lingual Language
Understanding [85.29270319872597]
我々は,XLMファインタニングの入力として言語間データを利用する拡張融合法を提案する。
推論中は、ターゲット言語で入力されたテキストとソース言語の翻訳に基づいて予測を行う。
この問題に対処するため,対象言語における翻訳テキストのための自動生成ソフト擬似ラベルに基づくモデル学習のためのKL分割自己学習損失を提案する。
論文 参考訳(メタデータ) (2020-09-10T22:42:15Z) - GLUECoS : An Evaluation Benchmark for Code-Switched NLP [17.066725832825423]
コード切替言語に対する評価ベンチマーク GLUECoS を提案する。
英語・ヒンディー語・英語・スペイン語におけるNLP課題について報告する。
我々は、人工的に生成されたコード切替データに基づいて、多言語モデルを微調整する。
論文 参考訳(メタデータ) (2020-04-26T13:28:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。