論文の概要: Head-Pose-Aware Visual Speech Recognition with FiLM Modulation
- arxiv url: http://arxiv.org/abs/2606.00751v1
- Date: Sat, 30 May 2026 14:35:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 00:57:58.92106
- Title: Head-Pose-Aware Visual Speech Recognition with FiLM Modulation
- Title(参考訳): FLM変調による頭部情報認識
- Abstract要約: 本稿では,頭部情報を視覚的特徴抽出に明示的に組み込んだポーズ対応音素レベルフレームワークHP-VSR-ResFiLMを提案する。
我々は,HP-VSR-ResFiLMが,訓練データに頼らずに,それぞれ25.0%,33.2%の単語誤り率(WER)で競合性能を達成することを示す。
- 参考スコア(独自算出の注目度): 1.3686940157259604
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual Speech Recognition (VSR) aims to recognize speech from visual cues such as lip movements, but its performance is fundamentally limited by viseme ambiguity and pose-induced variations that introduce geometric distortions and occlusions. Existing approaches mainly rely on linguistic context or implicit invariance, leaving visual representations insufficiently robust under non-frontal views. In this work, we propose a pose-aware phoneme-level framework, termed HP-VSR-ResFiLM, that explicitly incorporates head-pose information into visual feature extraction. The proposed framework adopts a two-stage pipeline consisting of a pose-conditioned visual encoder in Stage 1 and a pretrained NLLB language model in Stage 2 for phoneme-to-text reconstruction. Specifically, Stage 1 incorporates a pose-conditioned residual Feature-wise Linear Modulation (FiLM) block after the 2D CNN frontend to adaptively refine visual representations using head-pose information. Experiments on LRS2 and LRS3 demonstrate that HP-VSR-ResFiLM achieves competitive performance under comparable training conditions, attaining word error rates (WER) of 25.0% and 33.2%, respectively, without relying on additional training data. Ablation studies further show that a single residual FiLM block consistently improves overall WER, while deeper modulation at Layers 3 and 4 provides larger gains for samples with yaw angles greater than 30° without degrading performance for smaller pose variations. These findings demonstrate that explicit pose-aware feature modulation offers an effective and computationally efficient solution for improving VSR robustness in unconstrained settings.
- Abstract(参考訳): 視覚音声認識(VSR)は、唇の動きなどの視覚的手がかりから音声を認識することを目的としているが、その性能は、幾何学的歪みやオクルージョンを導入した視覚的あいまいさやポーズ誘発のバリエーションによって根本的に制限されている。
既存のアプローチは主に言語的文脈や暗黙の不変性に依存しており、視覚的表現は前向きでない視点下では不十分に堅牢である。
本稿では,HP-VSR-ResFiLMと呼ばれるポーズ対応音素レベルフレームワークを提案する。
提案フレームワークは,第1段におけるポーズ条件付きビジュアルエンコーダと第2段における事前訓練されたNLLB言語モデルからなる2段パイプラインを用いて,音素からテキストへの再構成を行う。
具体的には、ステージ1は2D CNNフロントエンドの後、ポーズ条件付残特徴量線形変調(FiLM)ブロックを組み込んで、頭部情報を用いて視覚表現を適応的に洗練する。
LRS2 と LRS3 の実験では、HP-VSR-ResFiLM は同等の訓練条件下で、それぞれ 25.0% と 33.2% の単語誤り率(WER)を、追加の訓練データに頼ることなく達成できることを示した。
さらに,1つの残留FiLMブロックはWER全体を一貫的に改善する一方,層3および4の深い変調は,より小さなポーズ変動に対する性能を低下させることなく,30°以上のヨー角を持つ試料に対して大きな利得を与えることを示した。
これらの結果は、明示的なポーズ認識機能変調が、制約のない環境でのVSRロバスト性を改善するための効率的で効率的なソリューションであることを示している。
関連論文リスト
- Wiener Representation Filtering for VLM Hallucination Suppression [45.33665443468439]
本稿では,言語バックボーンの表現空間で動作する,訓練のないポストホック表現編集手法を提案する。
隠れ状態を真と幻覚のフィルター成分の重ね合わせとしてモデル化することにより、ウィナー型推定器を導出する。
LLaVA1.53、MiniGPT-4、Gemma POPE、mOwl2の実験では、物体の幻覚が一貫した減少を示した。
論文 参考訳(メタデータ) (2026-08-08T14:51:17Z) - ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images [51.53960096934913]
リモートセンシングビジュアルグラウンドティング(RSVG)は、自由形式の自然言語記述を用いて、高解像度のRS画像中の特定の物体を特定することを目的としている。
マルチモーダル大言語モデル(MLLM)の最近の進歩は、そのようなオープン語彙RSVGに大きな可能性を示している。
Inemplar-driven Calibrated Refinement (ExACT)を提案する。
論文 参考訳(メタデータ) (2026-06-27T13:50:39Z) - Diffusion Large Language Models for Visual Speech Recognition [56.81307584718608]
本稿では,最初の拡散大言語モデル(DLLM)に基づく視覚音声認識(VSR)フレームワークを提案する。
DLLM-VSRは早期に高信頼位置をコミットし、コミットトークンを双方向コンテキストとして、曖昧なトークンを洗練させる。
我々は、ビデオ長を用いて、可塑性転写長仮説を構築する長さ誘導型候補復号法を開発した。
提案手法はラベル付きトレーニングデータのみを用いて, LRS3 上で19.5%の最先端 WER を実現する。
論文 参考訳(メタデータ) (2026-05-27T13:22:08Z) - A Two-Stage Dual-Modality Model for Facial Emotional Expression Recognition [5.014305646574725]
本稿では,第10回ABAWワークショップおよびコンペティションにおけるEXPR認識課題について論じる。
拘束されていないビデオから8つの顔の感情表現をフレームレベルで分類する必要がある。
これらの問題に対処する2段階のデュアルモーダル(音響・視覚)モデルを提案する。
論文 参考訳(メタデータ) (2026-03-12T17:45:12Z) - Suppressing VLM Hallucinations with Spectral Representation Filtering [49.52703800684483]
視覚言語モデル(VLM)は、画像に存在しないオブジェクト、属性、関係の記述の形で幻覚をしばしば生成する。
本稿では,モデル表現の共分散構造を解析し,補正することにより,このような幻覚を抑制するための軽量な訓練不要な手法であるスペクトル表現フィルタ(SRF)を提案する。
論文 参考訳(メタデータ) (2025-11-15T13:49:27Z) - GLip: A Global-Local Integrated Progressive Framework for Robust Visual Speech Recognition [72.29071664964633]
我々は、ロバストな視覚音声認識(VSR)のために設計されたグローバルローカル統合プログレッシブフレームワークGLipを提案する。
GLipは、グローバルな視覚的特徴とローカルな視覚的特徴の両方を、容易にアクセス可能な音声視覚データを用いて対応する音声音声単位に整合させることを学ぶ。
第2段階では、ローカル機能を関連するグローバルコンテキストと動的に統合するコンテキスト拡張モジュール(CEM)を導入します。
論文 参考訳(メタデータ) (2025-09-19T14:36:01Z) - Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction [1.778037147204838]
視覚自動音声認識(V-ASR)は、唇の動きや表情などの視覚情報のみから音声言語を解釈する課題である。
既存の手法は、しばしば視覚的手がかりから直接単語を予測することを目的としているが、視覚的曖昧さによる高いエラー率に悩まされることが多い。
本稿では,視覚的特徴とランドマーク的特徴を融合した新しい音素ベースの2段階フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-25T00:38:39Z) - WSCLoc: Weakly-Supervised Sparse-View Camera Relocalization [42.85368902409545]
WSCLocは、様々なディープラーニングベースの再ローカライゼーションモデルにカスタマイズできるシステムである。
最初の段階では、WSCLocはWFT-NeRFと呼ばれる多層パーセプトロン構造を用いて画像再構成の品質を最適化する。
第2段階では,事前学習したWFT-NeRFとWFT-Poseを併用する。
論文 参考訳(メタデータ) (2024-03-22T15:15:44Z) - OV-NeRF: Open-vocabulary Neural Radiance Fields with Vision and Language Foundation Models for 3D Semantic Understanding [9.25233177676278]
OV-NeRFは、事前訓練されたビジョンと言語基盤モデルのポテンシャルを利用して、セマンティックフィールド学習を強化する。
提案手法は, Replica と ScanNet の mIoU 測定値において, 20.31% と 18.42% の大幅な改善を実現している。
論文 参考訳(メタデータ) (2024-02-07T08:19:57Z) - Lip2Vec: Efficient and Robust Visual Speech Recognition via
Latent-to-Latent Visual to Audio Representation Mapping [4.271091833712731]
従来のモデルから学習するシンプルなアプローチであるLip2Vecを提案する。
提案手法は LRS3 データセット上で26 WER を達成する完全教師付き学習法と比較した。
我々は、VSRをASRタスクとして再プログラムすることで、両者のパフォーマンスギャップを狭め、より柔軟な唇読解法を構築することができると考えている。
論文 参考訳(メタデータ) (2023-08-11T12:59:02Z) - Learning to Decompose Visual Features with Latent Textual Prompts [140.2117637223449]
視覚言語モデルを改善するために,Decomposed Feature Prompting (DeFo)を提案する。
我々の実証研究は、視覚言語モデルを改善する上でDeFoが重要であることを示している。
論文 参考訳(メタデータ) (2022-10-09T15:40:13Z) - End-to-end Audio-visual Speech Recognition with Conformers [65.30276363777514]
ResNet-18とConvolution-augmented Transformer(Conformer)に基づくハイブリッドCTC/Attentionモデルを提案する。
特に、オーディオおよびビジュアルエンコーダは、生のピクセルとオーディオ波形から直接特徴を抽出することを学びます。
提案手法は, 音声のみ, 視覚のみ, および視聴覚実験において, 最先端の性能を高めることを実証する。
論文 参考訳(メタデータ) (2021-02-12T18:00:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。