論文の概要: Gloss-Free Representation Learning for Cross-Dataset Sign Spotting
- arxiv url: http://arxiv.org/abs/2608.11332v1
- Date: Tue, 11 Aug 2026 18:31:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.334419
- Title: Gloss-Free Representation Learning for Cross-Dataset Sign Spotting
- Title(参考訳): クロスデータセット符号スポッティングのためのグロスフリー表現学習
- Authors: Oğuz Akif Tüfekcioğlu, Ezgi Ekin, Mustafa Kaan Çevik, Hacer Yalim Keles,
- Abstract要約: 本研究では,この環境下で再利用可能な符号エンコーダを事前訓練することができるかを検討した。
トルコの新しい放送コーパスであるTSL-Newsを、転写から派生した擬似グロスラベルを用いて事前訓練した。
我々は、新しいTSLスポッティングベンチマーク上で、クロスデータセットの符号スポッティングにより学習した表現を評価する。
- 参考スコア(独自算出の注目度): 0.8590590965724384
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Sign-language research for resource-constrained languages is often limited by the cost of dense linguistic labels such as glosses, temporal boundaries, and sign order. Broadcast news offers a practical alternative by pairing continuous signing with spoken-language transcripts, but this supervision is weak since text and signing are loosely aligned. Morphologically rich languages such as Turkish add further difficulty, as the same lexical meaning can appear in many inflected forms while some derived forms should remain distinct. We study whether weak transcript-based supervision can pretrain a reusable sign encoder in this setting, where poor text normalization can fragment pseudo-gloss targets and weaken representation learning. Unlike prior pseudo-gloss pipelines designed mainly to improve translation, we test whether the pretrained encoder transfers as a reusable representation for cross-dataset sign spotting. We pretrain on TSL-News, a new Turkish broadcast corpus, using pseudo-gloss labels derived from transcripts rather than manual annotation, comparing rule-based morphological lemmatization with constrained LLM-assisted normalization over a fixed vocabulary. We evaluate the learned representations via cross-dataset sign spotting on a new TSL Spotting Benchmark built from the TSL Dictionary corpus. The LLM-assisted encoder raises top-5 temporal localization mean IoU from 0.235 to 0.465, with 56.2% of examples reaching an IoU of at least 0.50; a frequency analysis suggests this gain is not mainly driven by memorizing frequent pseudo-gloss labels. In a downstream translation check, the same pretraining improves BLEU-4 from 9.60 to 11.04 and ROUGE from 23.48 to 27.43. These results show that loosely aligned broadcast data can provide effective weak supervision for learning sign representations that capture both lexical content and temporal structure.
- Abstract(参考訳): 資源制約言語のための手話研究は、グロス、時間境界、手話順といった高密度な言語ラベルのコストによって制限されることが多い。
放送ニュースは、連続的な署名と話し言葉の書き起こしをペアにすることで、実用的な代替手段を提供するが、テキストと署名がゆるやかに一致しているため、この監督は弱い。
トルコ語のような形態学的に豊かな言語は、多くの屈折形に同じ語彙的意味が現れるが、いくつかの派生形は相変わらず存在する。
テキスト正規化の貧弱さが擬似グロスターゲットの断片化と表現学習の弱さを両立させる。
主に翻訳を改善するために設計された従来の擬似グロスパイプラインとは異なり、事前訓練されたエンコーダが、クロスデータセット符号スポッティングの再利用表現として転送されるかどうかをテストする。
規則に基づく形態素補間法と固定語彙上の制約付きLLM補助正規化との比較を行い,手書きアノテーションではなく手書き文字からの擬似グロスラベルを用いた新しいトルコ放送コーパスであるTSL-Newsを事前訓練した。
我々は、TSL辞書コーパスから構築した新しいTSLスポッティングベンチマーク上で、クロスデータセットの符号スポッティングにより、学習した表現を評価する。
LLM補助エンコーダは、トップ5の時間的ローカライゼーション平均IoUを0.235から0.465に引き上げ、56.2%のサンプルが少なくとも0.50のIoUに達する。
下流の翻訳チェックでは、BLEU-4 は 9.60 から 11.04 に、ROUGE は 23.48 から 27.43 に改善されている。
これらの結果から,ゆるやかにアライメントされた放送データは,語彙内容と時間構造の両方をキャプチャする手話表現の学習に有効な弱さに寄与することが示唆された。
関連論文リスト
- Sign Spotting Disambiguation using Large Language Models [29.79050316749927]
本稿では,Large Language Models(LLMs)を統合して,符号スポッティング品質を大幅に向上させる,学習自由フレームワークを提案する。
提案手法は,グローバル・テンポラル・ハンド形状の特徴を抽出し,その特徴を大規模手話辞書と照合する。
この辞書ベースのマッチングは本質的に、モデルの再訓練を必要とせず、より優れた語彙の柔軟性を提供する。
論文 参考訳(メタデータ) (2025-07-04T16:38:09Z) - Bridging Sign and Spoken Languages: Pseudo Gloss Generation for Sign Language Translation [48.20483623444857]
手話翻訳は、手話動画を音声テキストにマッピングすることを目的としている。
一般的なアプローチは、中間表現としてのグロスアノテーションに依存している。
そこで我々は,人間に注釈付けされたグルースを不要とした光沢のない擬似グルース生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-21T12:19:55Z) - Unlikelihood Tuning on Negative Samples Amazingly Improves Zero-Shot
Translation [79.96416609433724]
Zero-shot Translation (ZST)は、トレーニングデータにおいて、目に見えない言語ペア間の翻訳を目的としている。
推論中にゼロショット言語マッピングをガイドする一般的な方法は、ソースとターゲット言語IDを意図的に挿入することである。
近年の研究では、言語IDが時折ZSTタスクのナビゲートに失敗し、ターゲット外問題に悩まされることが示されている。
論文 参考訳(メタデータ) (2023-09-28T17:02:36Z) - Gloss-free Sign Language Translation: Improving from Visual-Language
Pretraining [56.26550923909137]
Gloss-Free Sign Language Translation (SLT) はドメイン横断性のために難しい課題である。
視覚言語事前学習(GFSLT-)に基づく新しいGross-free SLTを提案する。
i) コントラスト言語-画像事前学習とマスク付き自己教師付き学習を統合して,視覚的表現とテキスト的表現のセマンティックギャップをブリッジするプレタスクを作成し,マスク付き文を復元すること,(ii) 事前訓練されたビジュアルおよびテキストデコーダのパラメータを継承するエンコーダ-デコーダ-のような構造を持つエンドツーエンドアーキテクチャを構築すること,である。
論文 参考訳(メタデータ) (2023-07-27T10:59:18Z) - A Simple Multi-Modality Transfer Learning Baseline for Sign Language
Translation [54.29679610921429]
既存の手話データセットには、約10K-20Kの手話ビデオ、グロスアノテーション、テキストが含まれています。
したがって、データは効果的な手話翻訳モデルの訓練のボトルネックとなる。
この単純なベースラインは、2つの手話翻訳ベンチマークで過去の最先端の結果を上回っている。
論文 参考訳(メタデータ) (2022-03-08T18:59:56Z) - TSPNet: Hierarchical Feature Learning via Temporal Semantic Pyramid for
Sign Language Translation [101.6042317204022]
手話翻訳(SLT)は、手話のシーケンスをテキストベースの自然言語文に解釈することを目的としている。
既存のSLTモデルは通常、手話の視覚的特徴をフレーム的に表現する。
我々は,TSPNetと呼ばれる時間的意味ピラミッドネットワークを用いて,新しい階層的な手話ビデオ特徴学習手法を開発した。
論文 参考訳(メタデータ) (2020-10-12T05:58:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。