論文の概要: TVTA: Trajectory-Aware Viseme-Guided Temporal Aggregation for Event-Based Lip Reading
- arxiv url: http://arxiv.org/abs/2607.08236v1
- Date: Thu, 09 Jul 2026 08:33:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.470172
- Title: TVTA: Trajectory-Aware Viseme-Guided Temporal Aggregation for Event-Based Lip Reading
- Title(参考訳): TVTA:イベントベースのリップ読解のためのトラジェクトリ対応ビセメ誘導時間アグリゲーション
- Abstract要約: イベントベースの唇読解が視覚音声認識の有望な方向として登場した。
イベントベースの唇読解のための時間拡張フレームワークを提案する。
- 参考スコア(独自算出の注目度): 17.895146965920592
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Event-based lip reading has recently emerged as a promising direction for visual speech recognition, benefiting from the high temporal resolution and motion sensitivity of event cameras. However, existing methods typically perform spatial compression before sufficient temporal modeling, which may suppress sparse and localized motion trajectories that are crucial for distinguishing similar lip movements. Moreover, most current approaches optimize temporal representations mainly at the word-classification level, leaving the underlying articulatory structure weakly constrained. To address these limitations, we propose a temporally enhanced framework for event-based lip reading. First, we introduce Trajectory-Aware Differential Aggregation (TDA), which performs local temporal modeling at each spatial location before adaptive spatial aggregation. Second, we propose Viseme-Guided Aggregation (VGA), a unified temporal module composed of a CTC decoder and a viseme-guided gated aggregation branch, which injects viseme-aware sequence supervision and improves final temporal aggregation for word recognition. Third, we incorporate an EMA teacher--student training strategy to enhance robustness under strong event perturbations. Experiments on the DVS-Lip benchmark verify the effectiveness of the proposed design, and extensive ablation studies further validate the contributions of TDA, VGA, and teacher--student consistency. Qualitative decoding results also demonstrate that the proposed CTC-based temporal modeling learns meaningful viseme-aware structure from event streams.
- Abstract(参考訳): イベントベースのリップリーディングは、イベントカメラの高時間分解能と動き感度の恩恵を受け、視覚音声認識のための有望な方向として最近登場した。
しかし、既存の手法では、十分な時間的モデリングの前に空間圧縮を行い、類似の唇運動の識別に欠かせないスパースと局所的な運動軌跡を抑えることができる。
さらに、現代のほとんどのアプローチは、主に単語分類レベルで時間的表現を最適化し、基礎となる調音構造を弱く拘束する。
これらの制約に対処するために、イベントベースの唇読解のための時間的拡張フレームワークを提案する。
まず、適応的空間集約の前に各空間位置で局所時間モデリングを行うトラジェクトリ・アウェア微分アグリゲーション(TDA)を紹介する。
第2に、CTCデコーダとビセメ誘導ゲートアグリゲーションブランチで構成される統合時間モジュールであるVGAを提案し、ビセメ誘導シーケンスの監督を注入し、単語認識のための最終的な時間アグリゲーションを改善する。
第3に,強いイベント摂動下での堅牢性を高めるため,EMAの教員養成戦略を取り入れた。
DVS-Lipベンチマークの実験では,提案手法の有効性が検証され,TDA,VGA,教師の一貫性がさらに検証された。
定性的復号化の結果は,提案したCTCに基づく時間モデルがイベントストリームから意味のあるビセメ認識構造を学習することを示す。
関連論文リスト
- Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Rethinking Event-Based Object Dtection through Representation-Level Temporal Aggregation and Model-Level Hypergraph Reasoning [65.08890312027314]
イベントカメラはマイクロ秒レベルの時間分解能、低レイテンシ、高ダイナミックレンジを提供する。
Event Dual Temporal-Relational Aggregation Detector (Ev-DTAD)は、表現レベルの時間エンコーディングとモデルレベルの時間-ハイパーグラフ推論を統合する。
Ev-DTADは、コンパクトな時間的表現と時間的ハイパーグラフの特徴的推論の相補性を検証し、競争精度と効率のトレードオフを実現する。
論文 参考訳(メタデータ) (2026-05-09T09:20:34Z) - TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph [28.536724593429398]
TEn-CATGは、セマンティックキャリブレーションとカテゴリー対応の時間的推論を組み合わせたテキスト強化AVVPフレームワークである。
弱教師付きAVVPタスクにおいて,TEn-CATGは複雑な時間的および意味的依存関係を捕捉する堅牢性と優れた能力を実現する。
論文 参考訳(メタデータ) (2025-09-04T10:32:40Z) - OptiCorNet: Optimizing Sequence-Based Context Correlation for Visual Place Recognition [2.3093110834423616]
本稿では,新しいシーケンスモデリングフレームワークOptiCorNetを提案する。
空間的特徴抽出と時間的差分を微分可能でエンドツーエンドのトレーニング可能なモジュールに統一する。
本手法は,季節的・視点的な変化に挑戦し,最先端のベースラインよりも優れる。
論文 参考訳(メタデータ) (2025-07-19T04:29:43Z) - Context-aware TFL: A Universal Context-aware Contrastive Learning Framework for Temporal Forgery Localization [60.73623588349311]
本研究では,時間的フォージェリーローカライゼーションのための共通文脈対応コントラスト学習フレームワーク (UniCaCLF) を提案する。
提案手法は教師付きコントラスト学習を利用して,異常検出による偽造瞬間の検出と同定を行う。
実物と偽物との間における特徴の識別可能性の限界をさらに押し上げるために、効率的な文脈対応コントラスト符号化を導入する。
論文 参考訳(メタデータ) (2025-06-10T06:40:43Z) - StPR: Spatiotemporal Preservation and Routing for Exemplar-Free Video Class-Incremental Learning [79.44594332189018]
CIL(Class-Incremental Learning)は、以前取得した知識を使わずに、時間とともに新しいアクションカテゴリを継続的に学習するモデルの開発を目指している。
既存のアプローチでは、メモリとプライバシに関する懸念を忘れたり、あるいは時間的モデリングを無視する静的なイメージベースのメソッドを適用したりする。
本稿では,情報を明示的に切り離して保存する,統一的で非定型なVCILフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-20T06:46:51Z) - Spatiotemporal Multi-scale Bilateral Motion Network for Gait Recognition [3.1240043488226967]
本稿では,光学的流れに動機づけられた両動方向の特徴について述べる。
動作コンテキストを多段階の時間分解能でリッチに記述する多段階の時間表現を開発する。
論文 参考訳(メタデータ) (2022-09-26T01:36:22Z) - Temporal Transductive Inference for Few-Shot Video Object Segmentation [27.140141181513425]
Few-shot Object segmentation (FS-VOS) は、初期訓練中に見えないクラスのラベル付き例を用いて、ビデオフレームのセグメンテーションを目的としている。
我々のアプローチの鍵は、グローバルな時間的制約とローカルな時間的制約の両方を使用することである。
経験的に、我々のモデルは、YouTube-VIS上の組合間の平均交点を2.8%上回る、最先端のメタラーニングアプローチより優れている。
論文 参考訳(メタデータ) (2022-03-27T14:08:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。