論文の概要: Target-Side Paraphrase Augmentation for Sign Language Translation with Large Language Models
- arxiv url: http://arxiv.org/abs/2605.31393v1
- Date: Fri, 29 May 2026 14:58:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.684548
- Title: Target-Side Paraphrase Augmentation for Sign Language Translation with Large Language Models
- Title(参考訳): 大規模言語モデルを用いた手話翻訳のためのターゲット側パラフレーズ拡張
- Abstract要約: 我々は、GPT-4oが参照文の制御されたパラフレーズを生成できる目標側拡張について検討し、符号入力は変化しない。
PHOENIX14T, 適度な語彙の多様性を持つGSL, 高度に記録された反復的な記録を持つGSL, 重度の長尾間隔を有するLSA-Tの3つのデータセットについて検討した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sign language translation (SLT) remains constrained by limited paired sign-video/text corpora and heavy-tailed target vocabularies. We study target-side augmentation in which GPT-4o generates controlled paraphrase variants of reference sentences while the sign input remains unchanged. A Signformer-style pose-based Transformer is trained under a two-stage schedule: pre-training on the augmented corpus followed by fine-tuning on the original references. We evaluate on three datasets spanning complementary challenges: PHOENIX14T (German Sign Language), with moderate lexical diversity; GSL (Greek Sign Language), with highly ontrolled, repetitive recordings; and LSA-T (Argentinian Sign Language), with severe long-tail sparsity. On PHOENIX14T, augmentation improves BLEU-4 from 9.56 to 10.33. The near-saturated GSL baseline and extremely sparse LSA-T setting reveal the limits of the approach. To our knowledge, this is the first study to apply LLM-generated target-side araphrases and LLM-as-a-Judge evaluation to SLT. The semantic evaluation reveals gains in fidelity that lexical overlap metrics understate.
- Abstract(参考訳): 手話翻訳(SLT)は、限定された手話/テキストコーパスとヘビーテールのターゲット語彙によって制限されている。
我々は、GPT-4oが参照文の制御されたパラフレーズを生成できる目標側拡張について検討し、符号入力は変化しない。
SignformerスタイルのポーズベースのTransformerは、2段階のスケジュールでトレーニングされる。
PHOENIX14T (ドイツ語手話), GSL (ギリシャ手話), LSA-T (アルゼンチン手話), LSA-T (アルゼンチン手話) の3つの相補的課題について検討した。
PHOENIX14Tでは、BLEU-4が9.56から10.33に向上した。
ほぼ飽和なGSLベースラインと非常にスパースなLSA-T設定は、アプローチの限界を明らかにしている。
我々の知る限り、LSM生成標的側アラフラアーゼとLSM-as-a-Judge評価をSLTに適用した最初の研究である。
セマンティック評価は、語彙的重なり合いの指標が状態下にあるという忠実さの利得を明らかにする。
関連論文リスト
- Beyond BLEU: A Case for Redefining Sign Language Translation Benchmarks [25.06072679394636]
本稿では,オープンウェイトLLMQAプロトコルを用いて,言語学習の評価から着想を得た代替手法を提案する。
ヒトのランクとより密に一致し、BLEU-4の6倍から7倍のパラフレーズ不変量を持つ。
論文 参考訳(メタデータ) (2026-09-03T12:05:29Z) - Gloss-Free Representation Learning for Cross-Dataset Sign Spotting [0.8590590965724384]
本研究では,この環境下で再利用可能な符号エンコーダを事前訓練することができるかを検討した。
トルコの新しい放送コーパスであるTSL-Newsを、転写から派生した擬似グロスラベルを用いて事前訓練した。
我々は、新しいTSLスポッティングベンチマーク上で、クロスデータセットの符号スポッティングにより学習した表現を評価する。
論文 参考訳(メタデータ) (2026-08-11T18:31:57Z) - Beyond a Single Reference: Training and Evaluation with Paraphrases in Sign Language Translation [1.9102169745315323]
ほとんどの手話翻訳(SLT)コーパスペアは、それぞれ1つの書き言葉参照で署名された発話である。
この制限はモデルトレーニングと評価の両方を制約します。
BLEUparaは、複数のパラフレーズ参照に対する翻訳を評価するBLEUの拡張である。
論文 参考訳(メタデータ) (2026-01-29T00:02:19Z) - MaDiS: Taming Masked Diffusion Language Models for Sign Language Generation [78.75809158246723]
本稿では,SLGのためのマスク付き拡散型言語モデルであるMaDiSについて述べる。
また,トークン・ラテント・ヘアリング・3次元空間の目的から共同で学習する3段階のクロスモーダル事前学習手法を導入する。
MaDiSはDTWエラーと新たに導入された2つのメトリクスであるSiBLEUとSiCLIPを含む複数のメトリクスで優れたパフォーマンスを実現し、推論レイテンシを30%近く削減している。
論文 参考訳(メタデータ) (2026-01-27T13:06:47Z) - Lost in Translation, Found in Embeddings: Sign Language Translation and Alignment [84.39962912136525]
我々は手話翻訳(SLT)と手話字幕アライメント(SSA)を実行する手話理解モデルを開発する。
i)人間のキーポイントと唇領域の画像から手動と非手動のキューをキャプチャする軽量な視覚バックボーン,(ii)連続的な視覚特徴を単語レベルの埋め込みに集約するスライディングパーシーバーマッピングネットワーク,(iii)SLTとSSAを協調的に最適化するマルチタスクスケーラブルなトレーニング戦略である。
論文 参考訳(メタデータ) (2025-12-08T21:05:46Z) - RVLF: A Reinforcing Vision-Language Framework for Gloss-Free Sign Language Translation [44.39679803351263]
我々は手話に特化して設計された大規模視覚言語モデル(LVLM)を構築した。
手話の十分な表現のために、RVLFは効果的な意味表現学習機構を導入する。
そして,文レベルの意味的ミスアライメントを改善するために,GRPOに基づく最適化戦略を導入する。
論文 参考訳(メタデータ) (2025-12-08T08:11:53Z) - Signs as Tokens: A Retrieval-Enhanced Multilingual Sign Language Generator [55.94334001112357]
テキスト入力から3Dサインアバターを自動回帰的に生成できる多言語手話モデルSigns as Tokens(SOKE)を導入する。
単語レベルの正確な記号を提供するために,外部記号辞書を組み込んだ検索強化SLG手法を提案する。
論文 参考訳(メタデータ) (2024-11-26T18:28:09Z) - C${^2}$RL: Content and Context Representation Learning for Gloss-free Sign Language Translation and Retrieval [37.12863427950066]
グロースフリーなSLRLのための革新的な事前学習パラダイムC$2$RLを導入する。
C$2$RLはBLEU-4のスコアをP14Tで+5.3、CSLで+10.6、OpenASLで+6.2、How2Signで+1.3改善する。
また、P14Tでは+8.3、CSLでは+14.4、How2Signでは+5.9でR@1スコアが上昇した。
論文 参考訳(メタデータ) (2024-08-19T12:42:10Z) - Self-Augmented In-Context Learning for Unsupervised Word Translation [23.495503962839337]
大規模言語モデル (LLMs) は、強力な単語翻訳やバイリンガル語彙誘導(BLI)機能を示す。
教師なしBLIのための自己拡張型インコンテキスト学習(SAIL)を提案する。
提案手法は,2つの確立したBLIベンチマーク上でのLDMのゼロショットプロンプトよりも大幅に向上することを示す。
論文 参考訳(メタデータ) (2024-02-15T15:43:05Z) - Gloss-free Sign Language Translation: Improving from Visual-Language
Pretraining [56.26550923909137]
Gloss-Free Sign Language Translation (SLT) はドメイン横断性のために難しい課題である。
視覚言語事前学習(GFSLT-)に基づく新しいGross-free SLTを提案する。
i) コントラスト言語-画像事前学習とマスク付き自己教師付き学習を統合して,視覚的表現とテキスト的表現のセマンティックギャップをブリッジするプレタスクを作成し,マスク付き文を復元すること,(ii) 事前訓練されたビジュアルおよびテキストデコーダのパラメータを継承するエンコーダ-デコーダ-のような構造を持つエンドツーエンドアーキテクチャを構築すること,である。
論文 参考訳(メタデータ) (2023-07-27T10:59:18Z) - Translate to Disambiguate: Zero-shot Multilingual Word Sense
Disambiguation with Pretrained Language Models [67.19567060894563]
事前訓練された言語モデル(PLM)は、豊富な言語間知識を学習し、多様なタスクでうまく機能するように微調整することができる。
C-WLT(Contextual Word-Level Translation)を用いた言語間単語感覚の捉え方の検討を行った。
モデルのサイズが大きくなるにつれて、PLMはより言語間単語認識の知識をエンコードし、WLT性能を改善するためのコンテキストを良くする。
論文 参考訳(メタデータ) (2023-04-26T19:55:52Z) - Improving Sign Language Translation with Monolingual Data by Sign
Back-Translation [105.83166521438463]
本稿では,手話テキストを手話訓練に組み込んだ手話逆翻訳(SignBT)手法を提案する。
テキストからグロスへの翻訳モデルを用いて、まずモノリンガルテキストをそのグロスシーケンスに逆変換する。
そして、推定グロス・トゥ・サインバンクから特徴レベルで部品をスプライシングしてペアサインシーケンスを生成する。
論文 参考訳(メタデータ) (2021-05-26T08:49:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。