論文の概要: Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval
- arxiv url: http://arxiv.org/abs/2607.09263v1
- Date: Fri, 10 Jul 2026 10:26:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.820018
- Title: Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval
- Title(参考訳): 意味的硬さは視覚的硬さではない:手話検索のための手話否定的マイニング
- Abstract要約: SLRet(Sign Language Retrieval)は、手話コンテンツへの効率的なアクセスを可能にするが、きめ細かいシナリオでは脆弱である。
この制限は、モデルキャパシティではなく、非効率なハード負の監督によるものであることを示す。
本稿では,手話埋め込み空間における視覚的難解性に基づいて強陰性を構成する手話認識型ハード負マイニング(SAN)を提案する。
- 参考スコア(独自算出の注目度): 13.976034002467614
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sign Language Retrieval (SLRet) enables efficient access to sign language content but remains fragile in fine-grained scenarios where visually similar signs must be distinguished. We show that this limitation does not stem from model capacity, but from ineffective hard negative supervision. Specifically, we formulate fine-grained retrieval failures as a negative distribution mismatch: semantically distinct yet visually confusable signs are rarely treated as hard negatives, while existing text-based mining strategies fail to capture such visual ambiguity. To address this issue, we propose Sign-Aware Hard Negative Mining (SAN), which constructs hard negatives based on visual confusability in the sign embedding space rather than linguistic similarity. Experiments on PHOENIX-2014T demonstrate that SAN substantially improves fine-grained retrieval performance while preserving coarse-grained accuracy, highlighting the importance of aligning negative supervision with visual ambiguity in sign language retrieval.
- Abstract(参考訳): SLRet(Sign Language Retrieval)は、手話コンテンツへの効率的なアクセスを可能にするが、視覚的に類似した記号を区別しなければならない細粒度のシナリオでは脆弱である。
この制限は、モデルキャパシティではなく、非効率なハード負の監督によるものであることを示す。
具体的には,微粒化検索の失敗を負の分布ミスマッチとして定式化する: 意味的に区別されるが,視覚的に不明瞭な兆候をハードネガティブとして扱うことは滅多にないが,既存のテキストベースのマイニング戦略はそのような視覚的曖昧さを捉えることができない。
この問題に対処するために,手話的類似性ではなく,手話埋め込み空間における視覚的難解性に基づいて強陰性を構成する手話認識型ハードネガティブマイニング(SAN)を提案する。
PHOENIX-2014T実験により,手話検索における負の監督と視覚のあいまいさを協調させることの重要性を強調し,粗粒度精度を維持しながら,SANがきめ細かな検索性能を大幅に向上することを示した。
関連論文リスト
- Understanding Hardness of Vision-Language Compositionality from A Token-level Causal Lens [12.946160260124378]
対照的な言語-イメージ 事前学習は強力なクロスモーダルな一般化をもたらす。
オブジェクト、属性、関係性に対する構成的推論では、永続的に失敗する。
完全モーダル不変アライメントを実現する擬似最適テキストエンコーダの存在を示す。
論文 参考訳(メタデータ) (2025-10-30T09:41:21Z) - Learning Robust Negation Text Representations [60.23044940174016]
本稿では,テキストエンコーダの否定とヘッジを多種多様なパターンを用いて改善する戦略を提案する。
我々は,一般的なベンチマーク上での競合性能を維持しつつ,否定理解能力の大幅な向上を観察する。
提案手法は LLM に適用可能であり, ネゲーションベンチマークの性能向上に寄与する。
論文 参考訳(メタデータ) (2025-07-17T04:48:54Z) - Sign Spotting Disambiguation using Large Language Models [29.79050316749927]
本稿では,Large Language Models(LLMs)を統合して,符号スポッティング品質を大幅に向上させる,学習自由フレームワークを提案する。
提案手法は,グローバル・テンポラル・ハンド形状の特徴を抽出し,その特徴を大規模手話辞書と照合する。
この辞書ベースのマッチングは本質的に、モデルの再訓練を必要とせず、より優れた語彙の柔軟性を提供する。
論文 参考訳(メタデータ) (2025-07-04T16:38:09Z) - Signs as Tokens: A Retrieval-Enhanced Multilingual Sign Language Generator [55.94334001112357]
テキスト入力から3Dサインアバターを自動回帰的に生成できる多言語手話モデルSigns as Tokens(SOKE)を導入する。
単語レベルの正確な記号を提供するために,外部記号辞書を組み込んだ検索強化SLG手法を提案する。
論文 参考訳(メタデータ) (2024-11-26T18:28:09Z) - HNCSE: Advancing Sentence Embeddings via Hybrid Contrastive Learning with Hard Negatives [17.654412302780557]
HNCSEは、主要なSimCSEアプローチを拡張する、新しい対照的な学習フレームワークである。
HNCSEの目玉は、正と負の両方のサンプルの学習を強化するために、ハードネガティブサンプルの革新的な利用である。
論文 参考訳(メタデータ) (2024-11-19T01:26:20Z) - Revisiting subword tokenization: A case study on affixal negation in large language models [57.75279238091522]
現代英語大言語モデル(LLM)に対する接尾辞否定の影響を計測する。
我々は、異なるサブワードトークン化手法を用いてLLMを用いて実験を行う。
モデルは全体として、接尾辞の意味を確実に認識できることを示す。
論文 参考訳(メタデータ) (2024-04-03T03:14:27Z) - Strong hallucinations from negation and how to fix them [2.1178416840822027]
提案手法は,疎い負のデータに対する訓練を必要とせずに,クローゼプロンプトや否定を伴う自然言語推論タスクにおけるモデル性能を向上させることを示す。
このような応答をテキストストロング幻覚と呼び、論理演算子の内部表現とそれらの表現からの出力に対するLMの計算からそれに従うことを証明する。
論文 参考訳(メタデータ) (2024-02-16T10:11:20Z) - On the Importance of Signer Overlap for Sign Language Detection [65.26091369630547]
我々は,手話検出のための現在のベンチマークデータセットは,一般化が不十分な過度に肯定的な結果であると主張している。
我々は、現在の符号検出ベンチマークデータセットに対するシグナ重なりの影響を詳細に分析することでこれを定量化する。
我々は、重複のない新しいデータセット分割を提案し、より現実的なパフォーマンス評価を可能にします。
論文 参考訳(メタデータ) (2023-03-19T22:15:05Z) - Provable Limitations of Acquiring Meaning from Ungrounded Form: What
will Future Language Models Understand? [87.20342701232869]
未知のシステムが意味を習得する能力について検討する。
アサーションによってシステムが等価性のような意味関係を保存する表現をエミュレートできるかどうか検討する。
言語内のすべての表現が参照的に透明であれば,アサーションによってセマンティックエミュレーションが可能になる。
しかし、言語が変数バインディングのような非透過的なパターンを使用する場合、エミュレーションは計算不能な問題になる可能性がある。
論文 参考訳(メタデータ) (2021-04-22T01:00:17Z) - Watch, read and lookup: learning to spot signs from multiple supervisors [99.50956498009094]
孤立した手話のビデオが与えられた場合、我々のタスクは、連続的かつ協調的な手話ビデオで署名されたか、どこで署名されたかを特定することである。
我々は,(1)既存の粗末なラベル付き映像を見ること,(2)追加の弱スーパービジョンを提供する関連字幕を読むこと,(3)視覚手話辞書で単語を検索すること,の3つを用いて,利用可能な複数のタイプの監督手法を用いてモデルを訓練する。
これらの3つのタスクは、ノイズコントラスト推定と多重インスタンス学習の原則を用いて統合学習フレームワークに統合される。
論文 参考訳(メタデータ) (2020-10-08T14:12:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。