論文の概要: DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation
- arxiv url: http://arxiv.org/abs/2607.27614v1
- Date: Thu, 30 Jul 2026 03:02:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.371768
- Title: DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation
- Title(参考訳): DualAnchor:グロスフリー手話翻訳における言語優先の保存と語彙忠実度の改善
- Abstract要約: 我々は光沢のない手話翻訳学習フレームワークであるDualAnchorを提案する。
2つの相補的なアンカーを、言語的に流動的で視覚的に忠実な世代に分けている。
TPAは、マルチモーダルデコーダを正規化することで、言語を保存します。
OTAは、エントロピー規則化された部分的最適輸送として視覚テキストマッチングを定式化することにより、語彙の忠実度を向上させる。
- 参考スコア(独自算出の注目度): 30.38883468528891
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in large language models (LLMs) have led sign language translation (SLT), the task of converting sign-language videos into spoken-language text, to increasingly adopt LLMs as textual backbones. However, despite their strong language modeling capabilities, existing LLM-based SLT methods often undermine rather than exploit this language prior, producing disfluent translations, a failure we term language-prior degradation. Meanwhile, existing methods typically align videos and text at the sentence level, which does not ensure accurate lexical details and creates a lexical fidelity gap. To address both issues, we propose DualAnchor, a gloss-free LLM-based SLT training framework that couples two complementary anchors for linguistically fluent and visually faithful generation. Token-level Prior Anchoring (TPA) preserves the LLM's language prior by regularizing the multimodal decoder at each decoding step toward the next-token distribution of a frozen LLM conditioned on the same autoregressive prefix. Optimal Transport Alignment (OTA) improves lexical fidelity by formulating visual-textual matching as entropy-regularized partial optimal transport, with Sinkhorn optimization inducing a soft alignment between visual tokens and textual content tokens under a cosine cost. DualAnchor achieves strong overall performance on both PHOENIX-2014T and CSL-Daily. Targeted analyses attribute these gains to the complementary effects of the two anchors: TPA improves fluency, whereas OTA reduces fine-grained lexical errors.
- Abstract(参考訳): 大規模言語モデル(LLM)の最近の進歩は、手話動画を音声テキストに変換するタスクである手話翻訳(SLT)を導いており、LLMをテキストバックボーンとして採用している。
しかし、その強力な言語モデリング機能にもかかわらず、既存のLLMベースのSLTメソッドは、この言語を前もって利用するのではなく、しばしば損なわれる。
一方、既存の手法は通常、ビデオとテキストを文レベルで整列させるが、これは正確な語彙の詳細を保証せず、語彙の忠実さのギャップを生じさせる。
両問題に対処するため,言語学的に流動的で視覚的忠実な世代に相補的なアンカーを2つ組み合わせた,光沢のないLLMベースのSLTトレーニングフレームワークであるDualAnchorを提案する。
Token-level Prior Anchoring (TPA)は、各デコードステップでマルチモーダルデコーダを正規化し、同じ自己回帰プレフィックスで条件付けられた凍結LDMの次のトーケン分布に向けて、LLMの言語を前もって保存する。
最適トランスポートアライメント(OTA)は、視覚的テキストマッチングをエントロピー規則化された部分的最適トランスポートとして定式化し、シンクホーン最適化はコサインコストで視覚的トークンとテキストコンテンツトークン間のソフトアライメントを誘導する。
DualAnchorはPHOENIX-2014TとCSL-Dailyの両方で高い総合的なパフォーマンスを実現している。
ターゲティング分析は、これらが2つのアンカーの相補効果に起因している: TPAは流速を改善するが、OTAは微細な語彙誤差を減少させる。
関連論文リスト
- RVLF: A Reinforcing Vision-Language Framework for Gloss-Free Sign Language Translation [44.39679803351263]
我々は手話に特化して設計された大規模視覚言語モデル(LVLM)を構築した。
手話の十分な表現のために、RVLFは効果的な意味表現学習機構を導入する。
そして,文レベルの意味的ミスアライメントを改善するために,GRPOに基づく最適化戦略を導入する。
論文 参考訳(メタデータ) (2025-12-08T08:11:53Z) - Languages are Modalities: Cross-Lingual Alignment via Encoder Injection [0.8461674097042394]
本稿では、トークン化器を変更したり、デコーダを再訓練したりすることなく、命令調整されたデコーダを条件とした効率的な言語・モダリティ手法を提案する。
LLINKはバイリンガル検索を大幅に改善し、ベースモデルよりも81.3%の嗜好を得る。
改良は, トークン化インフレーションの低減と, より強いクロスリンガルアライメントに起因することが判明した。
論文 参考訳(メタデータ) (2025-10-31T07:43:21Z) - PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs [58.2469845374385]
進歩的アライメント表現訓練(PART)について紹介する。
Partは多段階およびマルチタスクのフレームワークで、言語内のアライメントと言語間のアライメントを分離する。
CommonVoice 15の実験では、Fleurs、Wenetspeech、CoVoST2が、Particleが従来のアプローチを上回ることを示している。
論文 参考訳(メタデータ) (2025-09-24T03:54:14Z) - Bridging Sign and Spoken Languages: Pseudo Gloss Generation for Sign Language Translation [48.20483623444857]
手話翻訳は、手話動画を音声テキストにマッピングすることを目的としている。
一般的なアプローチは、中間表現としてのグロスアノテーションに依存している。
そこで我々は,人間に注釈付けされたグルースを不要とした光沢のない擬似グルース生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-21T12:19:55Z) - FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing [81.3306413498174]
Movie Dubbingは、スクリプトを、時間的および感情的な両方の面において、所定の映画クリップと整合するスピーチに変換することを目的としている。
既存の手法は、リップシンクと音響品質の重要性を無視しながら、単語エラー率の低減に重点を置いている。
ダビングのための大規模言語モデル(LLM)に基づくフローマッチングアーキテクチャであるFlowDubberを提案する。
論文 参考訳(メタデータ) (2025-05-02T13:30:19Z) - LLaVA-SLT: Visual Language Tuning for Sign Language Translation [42.20090162339927]
近年の手話翻訳(SLT)の進歩は将来性を示しているが、精度の面ではグロスベースのアプローチに大きく遅れていることが多い。
我々はLLaVA-SLTというLarge Multimodal Model (LMM) フレームワークを紹介した。
LLaVA-SLTは最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-12-21T08:01:08Z) - LLMs are Good Sign Language Translators [19.259163728870696]
手話翻訳は,手話動画を音声言語に翻訳することを目的とした課題である。
本稿では,手話動画を言語的表現に変換する新しいSignLLMフレームワークを提案する。
広範に使用されている2つのSLTベンチマークにおいて、最先端のグロスフリーな結果が得られる。
論文 参考訳(メタデータ) (2024-04-01T05:07:13Z) - Building Accurate Translation-Tailored LLMs with Language Aware Instruction Tuning [57.323716555996114]
オフターゲット翻訳は、特に低リソース言語では未解決の問題である。
最近の研究は、翻訳命令の機能を強調するために高度なプロンプト戦略を設計するか、LLMの文脈内学習能力を活用している。
本研究では,LLMの命令追従能力(特に翻訳方向)を向上させるために,2段階の微調整アルゴリズムを設計する。
論文 参考訳(メタデータ) (2024-03-21T13:47:40Z) - Gloss-free Sign Language Translation: Improving from Visual-Language
Pretraining [56.26550923909137]
Gloss-Free Sign Language Translation (SLT) はドメイン横断性のために難しい課題である。
視覚言語事前学習(GFSLT-)に基づく新しいGross-free SLTを提案する。
i) コントラスト言語-画像事前学習とマスク付き自己教師付き学習を統合して,視覚的表現とテキスト的表現のセマンティックギャップをブリッジするプレタスクを作成し,マスク付き文を復元すること,(ii) 事前訓練されたビジュアルおよびテキストデコーダのパラメータを継承するエンコーダ-デコーダ-のような構造を持つエンドツーエンドアーキテクチャを構築すること,である。
論文 参考訳(メタデータ) (2023-07-27T10:59:18Z) - SimulSLT: End-to-End Simultaneous Sign Language Translation [55.54237194555432]
既存の手話翻訳手法では、翻訳を開始する前にすべてのビデオを読む必要がある。
我々は,最初のエンドツーエンド同時手話翻訳モデルであるSimulSLTを提案する。
SimulSLTは最新のエンドツーエンドの非同時手話翻訳モデルを超えるBLEUスコアを達成する。
論文 参考訳(メタデータ) (2021-12-08T11:04:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。