論文の概要: TAD: Token-Adaptive Contrastive Decoding with Confidence-Guided Gating for Hallucination Mitigation in Large Audio-Language Models
- arxiv url: http://arxiv.org/abs/2609.07286v1
- Date: Mon, 07 Sep 2026 09:54:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 00:55:57.737795
- Title: TAD: Token-Adaptive Contrastive Decoding with Confidence-Guided Gating for Hallucination Mitigation in Large Audio-Language Models
- Title(参考訳): TAD:大規模オーディオ言語モデルにおける幻覚緩和のための信頼誘導ゲーティングを用いたトークン適応コントラストデコーディング
- Abstract要約: 大型オーディオ言語モデル(LALM)は、音響オブジェクトを幻覚させ、音のイベントに「はい」と答える。
本研究では,幻覚緩和のための学習自由戦略であるToken-Adaptive Decoding (TAD)を提案する。
- 参考スコア(独自算出の注目度): 9.497925590553857
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large audio-language models (LALMs) can hallucinate audio objects, answering "yes" to absent sound events, thus undermining reliability in audio question answering. We propose Token-Adaptive Decoding (TAD), a training-free strategy for hallucination mitigation that grounds the initial yes/no decision by contrasting logits under real audio with a matched silent reference. TAD introduces a token-adaptive, confidence-guided gate that is decision-critical at the first decoding step and class-conditional on affirmative tokens, using the audio-silent margin to avoid overcorrection when evidence is weak or already sufficient. Experiments on AudioCaps-Hallucination show that, relative to Audio-Aware Decoding (AAD), a contrastive baseline with fixed contrast strength, TAD improves F1 for Qwen2 by 0.059 to 0.117 across Popular, Adversarial, and Random splits, and for Gemma by 0.025 to 0.064, while on Clotho-AQA it raises F1 from 0.810 to 0.816 on Qwen2 and remains comparable to AAD on Gemma.
- Abstract(参考訳): 大規模な音声言語モデル(LALM)は、音声オブジェクトを幻覚させ、不在な音声イベントに"yes"と応答することで、音声質問応答の信頼性を損なう。
本研究では,実際の音声下でのロジットと一致したサイレント参照とを対比することにより,初期イエス/ノー決定を根拠とした幻覚緩和のためのトレーニングフリー戦略であるToken-Adaptive Decoding (TAD)を提案する。
TADは、最初のデコードステップで決定クリティカルであり、肯定的トークンのクラス条件であるトークン適応型信頼誘導ゲートを導入し、証拠が弱い場合や既に十分である場合の過度な訂正を避けるために、オーディオサイレントマージンを使用する。
AudioCaps-Hallucinationの実験によると、AAD(Audio-Aware Decoding)と比較して、コントラストの強いコントラストベースラインであるTADは、Popular、Adversarial、Randomの分割でQwen2のF1を0.059から0.117に改善し、Gemmaは0.025から0.064に改善し、Clatho-AQAでは、Qwen2のF1を0.810から0.816に引き上げ、GemmaのAADに匹敵する。
関連論文リスト
- Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation [8.345705067210861]
既知のクローズドセットタスクでは、音響的エビデンスへのアクセスと、生成的オーディオモデルを呼び出す必要性が重要である。
我々はこの区別を制御された呼判断問題として評価する。
既知のタスクエンドポイントのクレームに対して、関連する量は、転写とエンコーダの証拠が既に使われている後の生成呼び出しの限界値である。
論文 参考訳(メタデータ) (2026-08-28T01:33:47Z) - Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning [44.01898427480094]
大型オーディオ言語モデル(LALM)は、音響理解を急速に進歩させてきたが、それでも細粒度のオーディオ推論に苦慮している。
本稿では,LALMにおけるラベルフリーな自己進化フレームワークであるAudio-Zeroを紹介する。
広義の音声理解を保ちながら,音の微妙な推論を改善したAudio-Zeroについて述べる。
論文 参考訳(メタデータ) (2026-07-22T14:03:25Z) - Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition [58.25449304752214]
生音声が既に利用可能である場合に、明示的な音響的手がかりが根拠となるかどうかを考察する。
標準化されたeGeMAPSパラ言語特徴集合から6つの解釈可能な音響概念トークンを導出する。
調整されたトークンは平均リコール(UAR)を改善するが、シャッフル、競合、破損したトークンはパフォーマンスを低下させる。
トークンのみの介入は、ALMに基づく感情計算において、オーディオグラウンドドキューの使用、堅牢性、解釈可能性を調べるための実用的な方法である、と我々は主張する。
論文 参考訳(メタデータ) (2026-06-05T14:26:06Z) - Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models [56.91801348360746]
大規模な音声言語モデル(LALM)は、音声、音声、音楽にまたがって一般化される。
統一デコーダは 時空間のスムーズなバイアスを示します
LALMの学習自由復号法であるemphTemporal Contrastive Decoding (TCD)を提案する。
論文 参考訳(メタデータ) (2026-04-16T02:30:41Z) - Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models [57.29797562658234]
オーディオ・ビジュアル言語モデル(AVLM)によるクロスモーダル幻覚のボトルネック
本稿では、この深い視覚的優位性に対応するために、オーディオコントラスト優先最適化(ACPO)を提案する。
ACPOは、音響事実としての視覚的記述をペナライズする出力コントラスト目的と、真の聴覚信号に不変な生成を明示的にペナライズするためにオーディオトラックを交換する入力コントラスト目的を導入する。
論文 参考訳(メタデータ) (2026-04-15T17:51:28Z) - When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion? [41.579901082251254]
実験結果から,Multimodal Large Language Models (MLLM) は視覚的に支配的な推論のため,存在しない音声の識別に苦慮していることが明らかとなった。
本稿では,RL-CoMM(Reinforcement Learning-based Collaborative Multi-MLLM)を紹介する。
1)視覚的に支配されるあいまいさを緩和するために、音声のみの推論を生成するための参照モデルとして、外部モデルであるLarge Audio Language Model (LALM)を導入する。
論文 参考訳(メタデータ) (2025-11-13T07:59:41Z) - Adaptive vector steering: A training-free, layer-wise intervention for hallucination mitigation in large audio and multimodal models [45.88028371034407]
本稿では,適応ベクトルステアリングによる音声コンテンツのより良い生成を提案する。
実験では、2つのモデルと2つのベンチマークで一貫したパフォーマンス向上を示している。
我々の知る限りでは、オーディオにおける幻覚を軽減するためにベクトルステアリングを適用した最初の研究である。
論文 参考訳(メタデータ) (2025-10-14T08:52:18Z) - Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding [54.82619273983179]
LALM(Large Audio-Language Models)は、オーディオに提示されるものを幻覚させる。
LALMの幻覚を軽減するためにオーディオ・アウェア・デコーディング(AAD)を導入する。
AADはコントラストデコーディングを使用して、トークン予測ログとオーディオコンテキストの有無を比較します。
論文 参考訳(メタデータ) (2025-06-08T17:36:50Z) - Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples [55.2480439325792]
近年の音声対応大型言語モデル(ALLM)により、音声入力の処理と理解が可能になった。
これらのモデルは、しばしば既存の音響イベントを幻覚させ、現実の応用における信頼性を低下させる。
LISTENは、現在と欠落した音を識別するallMsの能力を向上するコントラスト的な訓練法である。
論文 参考訳(メタデータ) (2025-05-20T15:44:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。