論文の概要: RAIDAL: Redundancy-Aware Information Density Active Learning for CTC-Based Continuous Sign Language Recognition
- arxiv url: http://arxiv.org/abs/2609.06843v2
- Date: Wed, 09 Sep 2026 22:38:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.052466
- Title: RAIDAL: Redundancy-Aware Information Density Active Learning for CTC-Based Continuous Sign Language Recognition
- Title(参考訳): RAIDAL: CTCに基づく連続手話認識のための冗長性を考慮した情報密度アクティブラーニング
- Abstract要約: RAIDALはCTCデコーダを再利用し,表現に基づくスコアリングをデコーダ対応の光沢領域に制限する。
RAIDALは、大規模で予算制限のある設定において、競合するベースラインよりも強力なデータ効率向上を実現している。
- 参考スコア(独自算出の注目度): 7.186818726913181
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Continuous sign language recognition (CSLR) is a key technology for accessibility, yet its development remains limited by the high cost of annotating continuous video streams. Active learning offers a path toward mitigating this cost, but standard acquisition functions are not designed for weakly aligned sign language videos, where sign executions are interleaved with rest poses, irregular pauses, sign-like motion, and temporally redundant frames. This temporal redundancy can undermine sample selection, as acquisition scores may be influenced by timesteps from regions that are not associated with the decoded gloss sequence, distorting the video's estimated informativeness. In this work, we show that modern CSLR models already contain a mechanism for identifying gloss-level temporal evidence: the CTC decoder. Although typically used only during inference, its alignment peaks indicate where the model localizes each predicted gloss in the feature sequence, providing a source of temporal structure for active learning acquisition functions at zero additional labeling cost. Thus, we introduce RAIDAL (Redundancy-Aware Information Density Active Learning), which repurposes the CTC decoder to restrict representation-based scoring to decoder-aligned gloss regions, rather than exposing the acquisition function to the entire unfiltered video. Across three datasets and two architectures, RAIDAL achieves its strongest data-efficiency gains over competing baselines in large-vocabulary, budget-limited settings, while remaining competitive in the smaller-vocabulary, large-budget setting. The code used in this work is publicly available at github.com/verlab/RAIDAL.
- Abstract(参考訳): 連続手話認識(CSLR)はアクセシビリティの重要な技術であるが、その開発は連続ビデオストリームのアノテートコストによって制限されている。
アクティブな学習は、このコストを軽減するための道筋を提供するが、標準的な取得関数は、手話ビデオの弱い整列のために設計されておらず、手話の実行には、ポーズポーズ、不規則なポーズ、手話のような動き、時間的に冗長なフレームが組み込まれている。
この時間的冗長性はサンプル選択を損なう可能性があり、取得スコアは復号されたグロスシーケンスに関連のない領域からのタイムステップに影響され、ビデオの推定情報性を歪める可能性がある。
本研究では,現代のCSLRモデルには既に光沢レベルの時間的エビデンス(CTCデコーダ)を識別する機構が組み込まれていることを示す。
通常、推論時にのみ使用されるが、アライメントピークは、モデルが予測される各光沢を特徴列にローカライズし、アクティブな学習獲得関数の時間的構造を付加的なラベリングコストゼロで提供することを示している。
そこで, RAIDAL (Redundancy-Aware Information Density Active Learning) を導入し, CTCデコーダを用いて表現に基づくスコアリングをデコーダ対応の光沢領域に制限する。
3つのデータセットと2つのアーキテクチャにわたって、RAIDALは、大語彙、予算制限のある設定において、競合するベースラインよりも強力なデータ効率向上を達成する一方で、小語彙、大予算設定では競争力を維持している。
この作業で使用されたコードはgithub.com/verlab/RAIDALで公開されている。
関連論文リスト
- SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting [1.3287545480967504]
MLLM誘導による手話認識とスポッティングのための時間的アライメントフレームワークを提案する。
SMARTは、動作記述を補助的なセマンティックキューとして使用し、小さなバッチトレーニングで安定したビデオテキストアライメントを実行する。
4つの手話ベンチマークの実験では、認識タスクとスポッティングタスクの両方でSMARTの有効性が示されている。
論文 参考訳(メタデータ) (2026-08-26T08:06:10Z) - LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs [90.77662862634509]
LiteFrameは、ビデオ大言語モデルのための強力な、しかし非常に効率的なバックボーンである。
LiteFrameはエンドツーエンドのレイテンシを35%削減し、8$times$より多くのフレームを処理する。
計算予算の固定化により,より長めの映像理解を解き明かす可能性を示した。
論文 参考訳(メタデータ) (2026-05-17T05:02:52Z) - FRAME: Pre-Training Video Feature Representations via Anticipation and Memory [55.046881477209695]
FRAMEは、高密度ビデオ理解に適した自己監督型ビデオフレームエンコーダである。
同社は、過去と現在のRGBフレームから現在と将来のDINOパッチ機能を予測することを学ぶ。
画像エンコーダや既存の自己監督型ビデオモデルよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-06-05T19:44:47Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z) - DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning [13.601154787754046]
DRCapはデータ効率が高く柔軟なゼロショットオーディオキャプションシステムである。
トレーニングにはテキストのみのデータが必要で、微調整を加えることなく、新しいドメインに迅速に適応できる。
論文 参考訳(メタデータ) (2024-10-12T10:21:00Z) - SEDS: Semantically Enhanced Dual-Stream Encoder for Sign Language Retrieval [82.51117533271517]
以前はRGBビデオをエンコードするだけで高レベルのセマンティックな特徴が得られていた。
既存のRGBベースの手話検索作業は、エンドツーエンドのトレーニングに埋め込まれた濃密な視覚データによる膨大なメモリコストに悩まされる。
本稿では,Semantically Enhanced Dual-Streamという手話表現フレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-23T11:31:11Z) - Continuous Sign Language Recognition Using Intra-inter Gloss Attention [0.0]
本研究では,手話認識研究において,インター・グロス・アテンション・モジュール(inter-inter gloss attention module)と呼ばれる新しいモジュールを導入する。
グロス内注目モジュールでは、動画を等サイズのチャンクに分割し、各チャンク内に自己注意機構を適用する。
PHOENIX-2014ベンチマークデータセットの実験結果から,本手法が手話の特徴をエンドツーエンドで効果的に抽出できることが示されている。
論文 参考訳(メタデータ) (2024-06-26T13:21:08Z) - Leveraging Temporal Contextualization for Video Action Recognition [47.8361303269338]
本稿では,TC-CLIP (Temporally Contextualized CLIP) と呼ばれる映像理解のためのフレームワークを提案する。
ビデオの時間的情報注入機構である時間的コンテキスト化(TC)を導入する。
Video-Prompting (VP)モジュールはコンテキストトークンを処理し、テキストのモダリティで情報的なプロンプトを生成する。
論文 参考訳(メタデータ) (2024-04-15T06:24:56Z) - SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by
Visual-Textual Contrastive Learning [51.800031281177105]
SignVTCLは、視覚・テキストのコントラスト学習によって強化された連続手話認識フレームワークである。
マルチモーダルデータ(ビデオ、キーポイント、光学フロー)を同時に統合し、統一された視覚バックボーンをトレーニングする。
従来の方法と比較して最先端の結果が得られます。
論文 参考訳(メタデータ) (2024-01-22T11:04:55Z) - TVTSv2: Learning Out-of-the-box Spatiotemporal Visual Representations at
Scale [59.01246141215051]
言語指導の観点から,その劣化要因を分析した。
本稿では,テキストエンコーダの一般化能力を維持するために,教師なし事前学習戦略を提案する。
最大10億のパラメータを持つTVTSv2と呼ばれる一連のモデルを作成します。
論文 参考訳(メタデータ) (2023-05-23T15:44:56Z) - Variational Stacked Local Attention Networks for Diverse Video
Captioning [2.492343817244558]
変動重畳ローカルアテンションネットワークは、低ランク双線形プールを自己注意的特徴相互作用に活用する。
構文と多様性の観点から,MSVD と MSR-VTT のデータセット上で VSLAN を評価する。
論文 参考訳(メタデータ) (2022-01-04T05:14:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。