論文の概要: $C^3$ASD: Multi-Level Consistency-Driven Representation Learning
- arxiv url: http://arxiv.org/abs/2607.03018v1
- Date: Fri, 03 Jul 2026 06:53:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.499057
- Title: $C^3$ASD: Multi-Level Consistency-Driven Representation Learning
- Title(参考訳): C^3$ASD:マルチレベル一貫性駆動表現学習
- Authors: Jin Hong, Jisoo Park, Junseok Kwon,
- Abstract要約: アクティブ話者検出は、ビデオ中の可視者が各瞬間に話しているかどうかを判定する。
我々は3つの相補的制約を持つ多レベル一貫性駆動フレームワークである$C3$ASDを提案する。
実験では、さまざまなオーディオ、視覚、関節の破損下での大幅な改善と、クリーンデータの競合性能の維持が示されている。
- 参考スコア(独自算出の注目度): 24.82888020124787
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Active Speaker Detection determines whether a visible person in a video is speaking at each moment. While recent audio-visual fusion methods perform well on clean data, they degrade under real-world corruptions such as background noise, occlusion, or simultaneous modality degradation. We attribute this limitation to the absence of explicit consistency constraints that promote robust, semantically aligned representations across modalities. Without such guidance, models tend to learn fragile modality-specific shortcuts that fail under corrupted conditions. We propose $C^3$ASD, a multi-level consistency-driven framework with three complementary constraints: embedding-level inter-modality consistency aligns audio-visual representations during speech; sequence-level intra-modality consistency separates speaking and non-speaking clusters via track-aware contrastive learning; and prediction-level consistency stabilizes fusion through knowledge distillation. Extensive experiments demonstrate significant improvements under diverse audio, visual and joint corruptions, while maintaining competitive performance on clean data.
- Abstract(参考訳): アクティブ話者検出は、ビデオ中の可視者が各瞬間に話しているかどうかを判定する。
最近の音声-視覚融合法はクリーンなデータでよく機能するが、背景雑音、閉塞、同時モダリティ劣化などの現実世界の汚職の下では劣化する。
この制限は、モダリティ間の堅牢で意味的に整合した表現を促進する明示的な一貫性の制約がないためである。
このようなガイダンスがなければ、モデルは破損した条件下で失敗する脆弱なモダリティ固有のショートカットを学ぶ傾向がある。
C^3$ASDは3つの相補的な制約を持つ多段階の一貫性駆動フレームワークである。組込みレベルのモダリティ整合性は、音声中の視覚的表現を整合させる; シーケンスレベルのモダリティ整合性は、トラック認識のコントラスト学習を通じて、話と非話のクラスタを分離する; 予測レベルの整合性は、知識蒸留による融合を安定化する。
大規模な実験は、さまざまなオーディオ、視覚、関節の破損の下で大幅に改善され、クリーンデータ上での競争性能は維持されている。
関連論文リスト
- Hidden in the Multiplicative Interaction: Uncovering Fragility in Multimodal Contrastive Learning [1.900736265330452]
ゲイト・シミュレイル(Gated Symile)は、注意に基づく、候補者ごとのモダリティ貢献を適応する対照的なゲーティング機構である。
Gated Symileは、よく調整されたSymileやCLIPモデルよりも高いトップ1検索精度を実現する。
論文 参考訳(メタデータ) (2026-04-07T13:03:30Z) - Deep Interest Mining with Cross-Modal Alignment for SemanticID Generation in Generative Recommendation [0.0]
Generative Recommendation (GR)は、数兆規模のデータを学習可能な語彙列に圧縮するためにセマンティックID(SID)に依存している。
既存の方法には3つの限界がある。
本稿では,Deep Contextual Interest Mining(DCIM),Cross-Modal Semantic Alignment(CMSA),Quality-Aware Reinforcement Mechanism(QARM)の3つの重要なイノベーションを統合する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-03T13:36:22Z) - TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech [11.020614074201346]
本稿では,音声・視覚的ヘイト検出を構造化推論問題に変換する統合フレームワークであるTANDEMを紹介する。
提案手法では,視覚言語モデルと音声言語モデルが相互に最適化される,新しいタンデム強化学習戦略を採用している。
TANDEM はゼロショットとコンテキスト拡張ベースラインを大きく上回り、HateMM のターゲット識別において 0.73 F1 を達成している。
論文 参考訳(メタデータ) (2026-01-16T10:52:12Z) - Test-time Adaptive Hierarchical Co-enhanced Denoising Network for Reliable Multimodal Classification [55.56234913868664]
マルチモーダルデータを用いた信頼性学習のためのTAHCD(Test-time Adaptive Hierarchical Co-enhanced Denoising Network)を提案する。
提案手法は,最先端の信頼性の高いマルチモーダル学習手法と比較して,優れた分類性能,堅牢性,一般化を実現する。
論文 参考訳(メタデータ) (2026-01-12T03:14:12Z) - Plug-and-Play Clarifier: A Zero-Shot Multimodal Framework for Egocentric Intent Disambiguation [60.63465682731118]
エゴセントリックなAIエージェントのパフォーマンスは、基本的にマルチモーダルな意図のあいまいさによって制限される。
ゼロショットでモジュラーなフレームワークであるPlug-and-Play Clarifierを導入し、問題を個別に解決可能なサブタスクに分解する。
我々のフレームワークは,小言語モデルの意図的明確化性能を約30%向上させ,より大きな言語モデルとの競争力を高める。
論文 参考訳(メタデータ) (2025-11-12T04:28:14Z) - CANDI: Hybrid Discrete-Continuous Diffusion Models [36.61898210733147]
ノイズが離散的なデータの分解を2つのメカニズムで示す: 離散的なアイデンティティの破損と連続的なランクの劣化である。
離散的・連続的な腐敗を分離するハイブリッドフレームワークであるCANDIを提案する。
これは離散空間に対する連続拡散の利点を解放する。
論文 参考訳(メタデータ) (2025-10-26T03:24:31Z) - Implicit Counterfactual Learning for Audio-Visual Segmentation [50.69377287012591]
我々は,非バイアスの相互理解を実現するために,暗黙の対実的枠組み(ICF)を提案する。
意味論の欠如により、異種表現は誤った一致につながる可能性がある。
モダリティ共有空間を確立するために,ビデオ,セグメント,フレームレベルを含む多粒性暗黙テキスト(MIT)をブリッジとして導入する。
論文 参考訳(メタデータ) (2025-07-28T11:46:35Z) - CLAMP: Contrastive Learning with Adaptive Multi-loss and Progressive Fusion for Multimodal Aspect-Based Sentiment Analysis [0.6961946145048322]
本稿では,Adaptive Multi-lossとProgressive Attention Fusionを用いた,エンドツーエンドのコントラスト学習フレームワークを提案する。
このフレームワークは、Progressive Attention Fusion Network、Multi-task Contrastive Learning、Adaptive Multi-loss Aggregationの3つの新しいモジュールで構成されている。
標準の公開ベンチマークによる評価は、CLAMPが既存の最先端技術よりも一貫して優れていることを示している。
論文 参考訳(メタデータ) (2025-07-21T11:49:57Z) - AVadCLIP: Audio-Visual Collaboration for Robust Video Anomaly Detection [57.649223695021114]
本稿では,ロバストなビデオ異常検出に音声と視覚の協調を利用する,弱教師付きフレームワークを提案する。
本フレームワークは,複数のベンチマークにおいて優れた性能を示し,オーディオ統合により異常検出精度が大幅に向上する。
論文 参考訳(メタデータ) (2025-04-06T13:59:16Z) - Looking into Your Speech: Learning Cross-modal Affinity for Audio-visual
Speech Separation [73.1652905564163]
本稿では,音声-視覚的ニューラル処理を用いて音声信号と映像を分離する問題に対処する。
従来の手法では、フレームワイドマッチング基準を用いて、音声とビデオの共有情報を抽出する。
音声と視覚ストリーム間の局所的な親和性だけでなく,グローバル通信を学習するクロスモーダル親和性ネットワーク(CaffNet)を提案する。
論文 参考訳(メタデータ) (2021-03-25T15:39:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。