論文の概要: Adaptive Perturbation Selection for Contrastive Audio Decoding
- arxiv url: http://arxiv.org/abs/2607.00247v1
- Date: Tue, 30 Jun 2026 22:55:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.655607
- Title: Adaptive Perturbation Selection for Contrastive Audio Decoding
- Title(参考訳): コントラスト音声復号のための適応摂動選択法
- Abstract要約: 大規模な音声言語モデル(LALM)は、しばしば言語先行と音響的証拠をオーバーライドすることによって幻覚を与える。
対照的な復号法(CD)はトレーニングなしの緩和を提供するが、既存の方法はマスキングやノイズのような鈍い摂動に依存している。
対象とする音声摂動の多様なライブラリを評価し,各タスクに対して最適な負の分岐を適応的に選択することで,この設計空間を探索する。
- 参考スコア(独自算出の注目度): 17.576102240052503
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large audio-language models (LALMs) frequently hallucinate by overriding acoustic evidence with language priors. While contrastive decoding (CD) offers training-free mitigation, existing methods rely on blunt perturbations like masking or noise, leaving structured audio transformations unexplored. We explore this design space by evaluating a diverse library of targeted audio perturbations and adaptively selecting the optimal negative branch for each task and example. First, we improve upon earlier prompt engineering by showing that a simple binary yes/no constraint reduces the model's tendency to falsely confirm absent audio features. Second, evaluating our library across temporal, spectral, frequency, and amplitude domains reveals that optimal transformations are highly task-dependent; for instance, reversing the audio array disrupts temporal coherence, raising accuracy on the temporal order task from 74.7% to 81.4%. Finally, we trained a light-weight perturbation selector on model hidden states to dynamically route negative branches, yielding an additional +4.3% gain on the existence task.
- Abstract(参考訳): 大規模な音声言語モデル(LALM)は、しばしば言語先行と音響的証拠をオーバーライドすることによって幻覚を与える。
対照的な復号法(CD)はトレーニングなしの緩和を提供するが、既存の手法はマスキングやノイズのような鈍い摂動に依存しており、構造化されたオーディオ変換は未探索のままである。
対象とする音声摂動の多様なライブラリを評価し,各タスクや例に対して最適な負の分岐を適応的に選択することで,この設計空間を探索する。
まず,従来のプロンプト・エンジニアリングを改良し,単純な二分法であるye/no制約が,不在な音声特徴を誤って確認する傾向を減少させることを示した。
第2に、時間、スペクトル、周波数、振幅領域でライブラリを評価すると、最適な変換はタスク依存度が高いことが示され、例えば、オーディオアレーの反転は時間的コヒーレンスを乱し、時間的順序タスクの精度を74.7%から81.4%に向上させる。
最後に、モデル隠れ状態の軽量摂動セレクタを訓練し、負の枝を動的にルートし、存在タスクでプラス4.3%の利得を得た。
関連論文リスト
- Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models [56.91801348360746]
大規模な音声言語モデル(LALM)は、音声、音声、音楽にまたがって一般化される。
統一デコーダは 時空間のスムーズなバイアスを示します
LALMの学習自由復号法であるemphTemporal Contrastive Decoding (TCD)を提案する。
論文 参考訳(メタデータ) (2026-04-16T02:30:41Z) - DiffSED: Sound Event Detection with Denoising Diffusion [70.18051526555512]
生成学習の観点からSED問題を再構築する。
具体的には,騒音拡散過程において,雑音のある提案から音の時間境界を生成することを目的としている。
トレーニング中は,ノイズの多い遅延クエリを基本バージョンに変換することで,ノイズ発生過程の逆転を学習する。
論文 参考訳(メタデータ) (2023-08-14T17:29:41Z) - DiffTAD: Temporal Action Detection with Proposal Denoising Diffusion [137.8749239614528]
そこで我々は,時間的行動検出(TAD)の新しい定式化を提案し,拡散を抑えるDiffTADを提案する。
入力されたランダムな時間的提案を考慮すれば、トリミングされていない長いビデオが与えられたアクションの提案を正確に得ることができる。
論文 参考訳(メタデータ) (2023-03-27T00:40:52Z) - High Fidelity Neural Audio Compression [92.4812002532009]
我々は、ニューラルネットワークを利用した最先端のリアルタイム、高忠実、オーディオを導入する。
ストリーミングエンコーダ-デコーダアーキテクチャと、エンドツーエンドでトレーニングされた量子化潜在空間で構成されている。
単一マルチスケール・スペクトログラム・アドバイザリーを用いて、トレーニングを簡素化し、高速化する。
論文 参考訳(メタデータ) (2022-10-24T17:52:02Z) - Switching Variational Auto-Encoders for Noise-Agnostic Audio-visual
Speech Enhancement [26.596930749375474]
本稿では,異なるVAEアーキテクチャを時間的に切り換えるために,マルコフの依存関係を持つ潜在逐次変数を導入する。
モデルのパラメータを推定し、音声信号を強化するために、対応する変動予測-最大化アルゴリズムを導出する。
論文 参考訳(メタデータ) (2021-02-08T11:45:02Z) - Temporal-Spatial Neural Filter: Direction Informed End-to-End
Multi-channel Target Speech Separation [66.46123655365113]
ターゲット音声分離とは、混合信号からターゲット話者の音声を抽出することを指す。
主な課題は、複雑な音響環境とリアルタイム処理の要件である。
複数話者混合から対象音声波形を直接推定する時間空間ニューラルフィルタを提案する。
論文 参考訳(メタデータ) (2020-01-02T11:12:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。