論文の概要: DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs
- arxiv url: http://arxiv.org/abs/2607.29112v1
- Date: Fri, 31 Jul 2026 07:40:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.646686
- Title: DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs
- Title(参考訳): DoubleHelix:LLMを用いたオーディオ・ビジュアル音声認識のための構造的クロスモーダルフュージョン
- Abstract要約: 本稿では,反復的相互モーダル相互作用プロセスとして融合を再構成する多モード融合フレームワークであるDoubleHelixを提案する。
LRS3の実験では、DoubleHelixはクリーンオーディオで0.68%のWERを達成した。
この枠組みは、評価バブルノイズ条件下での堅牢性の向上を示し、SNR -5dBで11.6%のWERを達成した。
- 参考スコア(独自算出の注目度): 7.315356347149304
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Audio-visual speech recognition (AVSR) relies on effective fusion of audio and visual modalities, yet existing approaches treat cross-modal interaction as a single-step operation without structured iterative refinement. We present DoubleHelix, a multimodal fusion framework that reformulates fusion as an iterative cross-modal interaction process with adaptive degradation-aware enhancement. The framework comprises three components including ReverseParallelHelix for multi-turn structured interaction with learned alignment constraints, QualitySensor for learning degradation-aware gating signals, and HelixReplication for consistency-guided conditional feature enhancement. Experiments on LRS3 demonstrate that DoubleHelix achieves 0.68% WER on clean audio, outperforming previous best results by 5.6% relative improvement under matched backbone settings. Comprehensive ablation studies validate each component contribution, including targeted analysis of design choices such as asymmetric pathway weighting. The framework shows improved robustness under evaluated babble-noise conditions, achieving 11.6% WER at SNR -5dB.
- Abstract(参考訳): 音声-視覚音声認識(AVSR)は、音声と視覚の効果的な融合に依存しているが、既存のアプローチでは、構造的反復的改善を伴わない単一ステップの操作として、モーダル間相互作用を扱う。
本稿では, 適応劣化認識向上を伴う反復的相互モーダル相互作用プロセスとして, 融合を再構成する多モード融合フレームワークであるDoubleHelixを提案する。
このフレームワークは、学習したアライメント制約とのマルチターン構造化インタラクションのためのReverseParallelHelix、劣化認識ゲーティング信号の学習のためのQualitySensor、一貫性誘導された条件付き特徴強調のためのHelixReplicationを含む3つのコンポーネントから構成される。
LRS3の実験では、DoubleHelixはクリーンオーディオで0.68%のWERを達成した。
包括的アブレーション研究は、非対称経路重み付けのような設計選択のターゲット分析を含む、各コンポーネントの寄与を検証する。
このフレームワークは、評価バブルノイズ条件下での堅牢性の向上を示し、SNR -5dBで11.6%のWERを達成した。
関連論文リスト
- OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation [60.95158352332569]
近年のジョイント・オーディオ・ビデオ・ジェネレーションの進歩は、モダリティ毎の忠実度、クロスモーダルアライメント、きめ細かい同期を強く要求している。
これらの欠点は、単一のグローバルな優位性を持つバニラRL微調整戦略が、しばしば準最適結果をもたらすことを示唆している。
提案するOmniNFTは,新しいモダリティ対応オンライン拡散RLフレームワークである。
論文 参考訳(メタデータ) (2026-05-12T17:56:59Z) - Multimodal Emotion Regression with Multi-Objective Optimization and VAD-Aware Audio Modeling for the 10th ABAW EMI Track [11.775637010038794]
本稿では,Hum-Vidmimic2データセット上での情動的ミミトリインテンシティ(EMI)推定トラックに焦点を当てる。
それは、賞賛、面白さ、決定、共感の痛み、引用、ジョイの6つの連続した感情の次元を予測することを目的としている。
本フレームワークは、結合に基づく多モード融合、共有6次元回帰ヘッド、MSEによる多目的最適化、ピアソン相関、補助分岐監督、パラメータ安定化のためのEMA、音響分岐に先立ってVADにインスパイアされた潜水器を統合する。
論文 参考訳(メタデータ) (2026-03-14T05:17:06Z) - Team RAS in 10th ABAW Competition: Multimodal Valence and Arousal Estimation Approach [53.64487844936037]
本手法は,顔,行動,音声の3つの相補的なモードを組み合わせる。
実験により,提案したマルチモーダル核融合戦略は, Aff-Wild2 開発セット上で0.658 の一致相関係数(CCC)を達成することを示した。
論文 参考訳(メタデータ) (2026-03-13T15:06:14Z) - TriFusion-SR: Joint Tri-Modal Medical Image Fusion and SR [42.84193423224821]
多モード医用画像融合は相補的構造情報と機能情報を集約することにより包括的診断を容易にする。
既存のアプローチは通常、画像融合と超解像(SR)を別々の段階で実行し、アーティファクトと知覚品質を劣化させる。
本稿では,TriFusionSRを提案する。TriFusionSRはウェーブレット誘導型三モード融合とSRのための条件拡散フレームワークである。
論文 参考訳(メタデータ) (2026-03-10T14:13:40Z) - VocSegMRI: Multimodal Learning for Precise Vocal Tract Segmentation in Real-time MRI [14.398038581000302]
VocSegMRIは,映像,音声,音声の入力を相互注意融合により統合するフレームワークである。
Diceスコアは0.95、Hausdorff Distance(HD_95)は4.20mmである。
論文 参考訳(メタデータ) (2025-09-17T07:32:00Z) - AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition [2.4842074869626396]
双方向モダリティ向上に基づく新しいAVSRフレームワークAD-AVSRを提案する。
具体的には、まず、複数の視点から音声表現を豊かにするための音声二重ストリーム符号化方式を導入する。
我々は、無関係または弱相関のオーディオ視覚対をフィルタリングするために閾値に基づく選択機構を採用する。
論文 参考訳(メタデータ) (2025-08-11T04:23:08Z) - United we stand, Divided we fall: Handling Weak Complementary Relationships for Audio-Visual Emotion Recognition in Valence-Arousal Space [3.1856756516735922]
本稿では,Gated Recursive Joint Cross Attention (GRJCA)について,最も関連性の高い特徴を適応的に選択可能なゲーティング機構を用いて紹介する。
提案手法は, 補間関係の弱さに対処する柔軟性を付加することにより, RJCAモデルの性能を向上させる。
論文 参考訳(メタデータ) (2025-03-15T21:03:20Z) - Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition [3.5803801804085347]
本稿では,RJCMA(Recursive Joint Cross-Modal Attention)を導入し,音声,視覚,テキストの両モード間の相互関係を次元的感情認識のために捉える。
特に,共同音声・視覚・テキスト特徴表現と個々のモーダルの特徴表現との相互相関に基づく注目重みの計算を行う。
Affwild2データセット上で提案した核融合モデルの性能を評価するために大規模な実験を行った。
論文 参考訳(メタデータ) (2024-03-20T15:08:43Z) - MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition [62.89464258519723]
異なるレベルのオーディオ/視覚エンコーダに融合することで、各モードの表現を促進する多層クロスアテンション融合に基づくAVSR手法を提案する。
提案手法は第1位システムを超え,新たなSOTA cpCERの29.13%をこのデータセット上に構築する。
論文 参考訳(メタデータ) (2024-01-07T08:59:32Z) - Cross-modal Audio-visual Co-learning for Text-independent Speaker
Verification [55.624946113550195]
本稿では,モーダルな発話協調学習パラダイムを提案する。
モーダル変換相関を学習するために、2つのクロスモーダルブースターを導入する。
LRSLip3, GridLip, LomGridLip, VoxLip を用いた実験の結果,提案手法は平均相対性能を60%, 20%向上させることがわかった。
論文 参考訳(メタデータ) (2023-02-22T10:06:37Z) - Low-complexity deep learning frameworks for acoustic scene
classification [64.22762153453175]
音響シーン分類(ASC)のための低複雑さ深層学習フレームワークを提案する。
提案するフレームワークは、フロントエンドのスペクトログラム抽出、オンラインデータ拡張、バックエンドの分類、予測される確率の後期融合の4つの主要なステップに分けることができる。
DCASE 2022 Task 1 Development データセットで実施した実験は,低複雑さの要求を十分に満たし,最も高い分類精度を 60.1% で達成した。
論文 参考訳(メタデータ) (2022-06-13T11:41:39Z) - Scenario Aware Speech Recognition: Advancements for Apollo Fearless
Steps & CHiME-4 Corpora [70.46867541361982]
本稿では、TRILLと呼ばれる三重項損失に基づく自己監督基準で訓練された一般的な非意味的音声表現について考察する。
我々は、Fearless Stepsの開発と評価のために、+5.42%と+3.18%の相対的なWER改善を観察した。
論文 参考訳(メタデータ) (2021-09-23T00:43:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。