論文の概要: The Attention Triangle in Audio-Video Models
- arxiv url: http://arxiv.org/abs/2609.03586v1
- Date: Thu, 03 Sep 2026 09:33:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.003325
- Title: The Attention Triangle in Audio-Video Models
- Title(参考訳): 音響映像モデルにおける注意三角形
- Authors: Sagi Polaczek, Noa Kraicer, Gal Metzer, Zhuo Ning, Ali Mahdavi-Amiri, Daniel Cohen-Or, Raja Giryes,
- Abstract要約: 音声・ビデオ拡散モデルは、テキスト、音声、視覚内容の調整にモーダルな注意を頼っているが、この機構は微妙で体系的な意味的漏洩をもたらす可能性がある。
テキスト,音声,ビデオストリームを接続する3つの横断的エッジからなる「注意三角形」を探索し,解析することにより,これらのモデルについて検討する。
音声は映像生成に影響を及ぼし、ビデオは音声生成に影響を及ぼす。
- 参考スコア(独自算出の注目度): 67.46972888113658
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Audio-video diffusion models rely on cross-modal attention to coordinate text, sound, and visual content, yet this same mechanism can introduce subtle and systematic semantic leakage. We study these models by probing and analyzing the ``attention triangle,'' comprising the three cross-attention edges connecting the text, audio, and video streams, and examine how semantic information is routed across modalities during generation. Our analysis reveals that routing along the audio-video edge is bidirectional: audio can influence video generation, while video can influence audio generation. This edge is shaped by biases encoded in the model's parameters and emerges as a major contributor to leakage: when prompts are in tension with learned priors, cross-modal interactions may override the intended conditioning and reroute semantics toward visually canonical but incorrect outcomes. These effects suggest that semantic artifacts arise not merely from attention spreading beyond its intended target, but from structured, bias-driven interactions along specific pathways. Building on this perspective, we extract attention-derived signals that expose how semantics are distributed and grounded across modalities, and use them as a diagnostic tool to both analyze and deliberately incur leakage under controlled conditions. This enables us to probe the internal dynamics of cross-modal routing and isolate the role of individual interactions. We further leverage these signals to guide inference-time interventions that encourage more consistent cross-modal alignment. Extensive experiments support our analysis and demonstrate improved semantic grounding while preserving generation quality.
- Abstract(参考訳): 音声・ビデオ拡散モデルは、テキスト、音声、視覚内容の調整にモーダルな注意を頼っているが、この機構は微妙で体系的な意味的漏洩をもたらす可能性がある。
本研究では,テキスト,音声,ビデオストリームを接続する3つの横断的エッジからなる「注意三角形」を探索・解析し,世代間の意味情報の経路について検討する。
音声は映像生成に影響を及ぼし、ビデオは音声生成に影響を及ぼす。
このエッジは、モデルのパラメータにエンコードされたバイアスによって形成され、漏洩の主要な要因として現れる: プロンプトが学習前と緊張しているとき、クロスモーダルな相互作用は、意図された条件付けをオーバーライドし、視覚的に正統的だが誤った結果へと意味論を還元する。
これらの効果は、意味的アーティファクトは、意図された対象を越えて注意が広がるだけでなく、特定の経路に沿った構造的、偏見駆動的な相互作用から生じることを示唆している。
この視点から,意味論の分散とモダリティの接地方法を明らかにする注目信号の抽出を行い,これらを診断ツールとして利用することにより,制御条件下での漏洩を解析・故意に発生させる。
これにより、クロスモーダルルーティングの内部ダイナミクスを探索し、個別の相互作用の役割を分離することができる。
さらにこれらの信号を活用して、より一貫性のあるクロスモーダルアライメントを促進する推論時間の介入を誘導します。
大規模な実験は、我々の分析をサポートし、生成品質を維持しながら、セマンティックグラウンドの改善を実証する。
関連論文リスト
- Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation [113.24577778437295]
Batonは、共同ビデオオーディオ生成に明示的なセマンティックプランニングを導入するフレームワークである。
我々の重要な洞察は、粗いテキストガイダンスを意味的にリッチでモダリティを意識したトークンで補完することで、細かなセマンティックディテールを同時に復元できるということです。
ベンチマークの実験は、バトンの有効性を質的にも定量的にも示している。
論文 参考訳(メタデータ) (2026-05-24T17:55:11Z) - Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought [49.53567098922619]
モーダル間干渉を低減するための音声・視覚的推論フレームワークとして, 分離ファースト, ファウズ・レイト (SFFL) を提案する。
SFFLは、モーダリティ固有の連鎖推論を強制し、別々の音声および視覚的推論トレースを生成し、答えのエビデンスを統合する。
実験では精度と頑健さの両面で一貫した改善が示され、一般的なAVQAベンチマークでは5.16%、クロスモーダル幻覚ベンチマークでは11.17%の平均的な相対的な増加が得られた。
論文 参考訳(メタデータ) (2026-05-11T02:50:27Z) - In-Context Audio Control of Video Diffusion Transformers [28.911323185865186]
本稿では,ビデオ拡散変換器(ICAC)の音環境制御について述べる。
本稿では,FullDiTに似た統合されたフルアテンションアーキテクチャにおいて,音声による映像生成のための音声信号の統合について検討する。
本研究では,注意パターンを制約して時間的アライメントを強制し,安定したトレーニングと優れたパフォーマンスを実現するMasked 3D Attention機構を提案する。
論文 参考訳(メタデータ) (2025-12-21T15:22:28Z) - Implicit Counterfactual Learning for Audio-Visual Segmentation [50.69377287012591]
我々は,非バイアスの相互理解を実現するために,暗黙の対実的枠組み(ICF)を提案する。
意味論の欠如により、異種表現は誤った一致につながる可能性がある。
モダリティ共有空間を確立するために,ビデオ,セグメント,フレームレベルを含む多粒性暗黙テキスト(MIT)をブリッジとして導入する。
論文 参考訳(メタデータ) (2025-07-28T11:46:35Z) - Unveiling and Mitigating Bias in Audio Visual Segmentation [9.427676046134374]
コミュニティ研究者は、物体のマスクの音質を改善するために、様々な高度なオーディオ視覚セグメンテーションモデルを開発した。
これらのモデルによって作られたマスクは、最初は可塑性に見えるかもしれないが、しばしば誤った接地論理を持つ異常を示す。
我々はこれを、複雑なオーディオ・視覚的グラウンドよりも単純な学習信号として、現実世界固有の嗜好と分布に帰着する。
論文 参考訳(メタデータ) (2024-07-23T16:55:04Z) - CM-PIE: Cross-modal perception for interactive-enhanced audio-visual
video parsing [23.85763377992709]
本稿では,セグメントベースアテンションモジュールを適用して,細粒度の特徴を学習できる対話型クロスモーダル認識手法(CM-PIE)を提案する。
当社のモデルでは、Look、Listen、Parseデータセットのパースパフォーマンスが改善されています。
論文 参考訳(メタデータ) (2023-10-11T14:15:25Z) - Cross-Modal Attention Consistency for Video-Audio Unsupervised Learning [141.38505371646482]
クロスモーダル相関は、ビデオ教師なし表現学習に固有の監督を提供する。
本稿では,双方向の局所通信特性を探索するために,CMAC(Cross-Modal Attention Consistency)というプレテキストタスクを導入する。
CMACは、視覚信号から純粋に発生する局所的注意と、音響信号の誘導の下で発生する対象的注意とを一致させることを目的としている。
論文 参考訳(メタデータ) (2021-06-13T07:41:15Z) - Look, Listen, and Attend: Co-Attention Network for Self-Supervised
Audio-Visual Representation Learning [17.6311804187027]
音声と視覚イベントの相関関係は、ニューラルネットワークをトレーニングするための自由教師付き情報として利用することができる。
本稿では,非競合ビデオから汎用的なクロスモーダル表現を学習するためのコアテンション機構を備えた,新しい自己教師型フレームワークを提案する。
実験の結果,従来の手法に比べてパラメータが少なめでありながら,プレテキストタスク上での最先端性能が得られた。
論文 参考訳(メタデータ) (2020-08-13T10:08:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。