論文の概要: Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
- arxiv url: http://arxiv.org/abs/2604.14129v1
- Date: Wed, 15 Apr 2026 17:51:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-16 20:38:32.666477
- Title: Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
- Title(参考訳): ビデオ通話を許さない:オーディオ・ビジュアル言語モデルのための音声コントラスト優先最適化
- Abstract要約: オーディオ・ビジュアル言語モデル(AVLM)によるクロスモーダル幻覚のボトルネック
本稿では、この深い視覚的優位性に対応するために、オーディオコントラスト優先最適化(ACPO)を提案する。
ACPOは、音響事実としての視覚的記述をペナライズする出力コントラスト目的と、真の聴覚信号に不変な生成を明示的にペナライズするためにオーディオトラックを交換する入力コントラスト目的を導入する。
- 参考スコア(独自算出の注目度): 57.29797562658234
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Audio-Visual Language Models (AVLMs) have achieved remarkable progress over recent years, their reliability is bottlenecked by cross-modal hallucination. A particularly pervasive manifestation is video-driven audio hallucination: models routinely exploit visual shortcuts to hallucinate expected sounds, discarding true auditory evidence. To counteract this deeply ingrained visual dominance, we propose Audio-Contrastive Preference Optimization (ACPO). This dual-axis preference learning framework introduces an output-contrastive objective to penalize visual descriptions masquerading as audio facts, alongside an input-contrastive objective that swaps audio tracks to explicitly penalize generation invariant to the true auditory signal. Extensive experiments demonstrate that ACPO establishes highly faithful audio grounding and mitigates audio hallucination without compromising overarching multimodal capabilities.
- Abstract(参考訳): 近年,オーディオ・ビジュアル言語モデル (AVLM) は目覚ましい進歩を遂げているが,その信頼性はモデム間の幻覚によってボトルネックになっている。
モデルは予想される音を幻覚させるために視覚的ショートカットを日常的に利用し、真の聴覚的証拠を捨てる。
このような視覚的優位性に対処するため,音響コントラスト優先最適化(ACPO)を提案する。
この2軸選好学習フレームワークは、音声の事実として生ずる視覚的記述をペナルティ化する出力コントラスト的目的と、音声トラックを交換して真の聴覚信号に不変な生成を明示的にペナルティ化する入力コントラスト的目的を導入する。
広汎な実験により、ACPOは、マルチモーダル機能に妥協することなく、高度に忠実なオーディオ接地を確立し、オーディオ幻覚を緩和することを示した。
関連論文リスト
- Exploring Audio Hallucination in Egocentric Video Understanding [66.1760617001607]
最先端の大規模音声視覚言語モデル(AV-LLM)はマルチモーダルな記述を生成することができる。
本研究では、視覚的手がかりから音を推測するが、聴くことができない。
論文 参考訳(メタデータ) (2026-04-26T20:06:58Z) - HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models [30.18524844766061]
HalluAudioは、音声、環境音、音楽の幻覚を評価するための最初の大規模ベンチマークである。
HalluAudioは、5万以上の人間による検証されたQAペアで構成され、バイナリ判断、複数選択推論、属性検証、オープンエンドQAなど、さまざまなタスクタイプにまたがる。
以上の結果から, 音場, 時間的推論, 音楽属性の理解において, 信頼性とロバスト性を考慮したLALMの必要性が示唆された。
論文 参考訳(メタデータ) (2026-04-21T10:05:28Z) - Semantic visually-guided acoustic highlighting with large vision-language models [34.707752102338816]
現在のオーディオミキシングは、手作業と労働集約がほとんどである。
コンディショニング信号としてどの視覚的側面が最も効果的かは定かではない。
我々は,どのビジュアル・セマンティック・キューがコヒーレントで視覚的に整合したオーディオリミックスを最も強くサポートしているかを同定する。
論文 参考訳(メタデータ) (2026-01-12T01:30:15Z) - OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination [32.43796002503023]
Omni-modal large language model (OLLM) における幻覚を軽減するために設計された好み調整フレームワークであるOmniDPOを提案する。
両課題に対処することにより、OmniDPOはマルチモーダルグラウンドを効果的に改善し、幻覚を減少させる。
論文 参考訳(メタデータ) (2025-08-31T07:19:32Z) - Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples [55.2480439325792]
近年の音声対応大型言語モデル(ALLM)により、音声入力の処理と理解が可能になった。
これらのモデルは、しばしば既存の音響イベントを幻覚させ、現実の応用における信頼性を低下させる。
LISTENは、現在と欠落した音を識別するallMsの能力を向上するコントラスト的な訓練法である。
論文 参考訳(メタデータ) (2025-05-20T15:44:01Z) - Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos [87.32349247938136]
既存のアプローチでは、トレーニング中にビデオとオーディオの完全な対応を暗黙的に仮定する。
環境に配慮した新しいオーディオ生成モデルAV-LDMを提案する。
我々のアプローチは、観察された視覚コンテンツに忠実にビデオ・オーディオ生成を集中させる最初の方法である。
論文 参考訳(メタデータ) (2024-06-13T16:10:19Z) - LA-VocE: Low-SNR Audio-visual Speech Enhancement using Neural Vocoders [53.30016986953206]
雑音の多い音声・視覚音声からのメルスペクトルをトランスフォーマーベースアーキテクチャにより予測する2段階のアプローチであるLA-VocEを提案する。
我々は、何千もの話者と11以上の異なる言語でフレームワークを訓練し、評価し、異なるレベルのバックグラウンドノイズや音声干渉に適応するモデルの能力について研究する。
論文 参考訳(メタデータ) (2022-11-20T15:27:55Z) - Visually-Aware Audio Captioning With Adaptive Audio-Visual Attention [54.4258176885084]
曖昧な音を正確に認識する方法は、音声キャプションにとって大きな課題である。
本稿では,視覚情報を利用して不明瞭な音の物体の記述を支援する視覚認識型音声キャプションを提案する。
提案手法は,機械翻訳メトリクスの最先端結果を実現する。
論文 参考訳(メタデータ) (2022-10-28T22:45:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。