論文の概要: REVE: Efficient Hallucination Correction for Large Audio-Language Models via Reused Encoder States
- arxiv url: http://arxiv.org/abs/2609.26028v1
- Date: Tue, 22 Sep 2026 11:32:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.343299
- Title: REVE: Efficient Hallucination Correction for Large Audio-Language Models via Reused Encoder States
- Title(参考訳): REVE: 再使用エンコーダ状態による大規模オーディオ言語モデルの効率的な幻覚補正
- Abstract要約: 大規模な音声認識モデルでは、入力から外れた音響イベントが言及されることがある。
別個のオーディオイベント検出器がこれらの言及を確認することができるが、それを行うには第2のオーディオエンコーダと別のフォワードパスが必要である。
対象モデルによって既に計算されている状態を利用する軽量な手法であるREVE(Reused States for Verifying Events)を提案する。
- 参考スコア(独自算出の注目度): 16.279587296914993
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large audio-language models may mention acoustic events that are absent from the input. A separate audio event detector can verify these mentions, but doing so requires a second audio encoder and a separate forward pass. We propose Reused Encoder States for Verifying Events (REVE), a lightweight method that uses states already computed by the target model. One readout summarizes class scores across audio frames, while another uses pooled states from four consecutive frame intervals. Class-aware score fusion combines their outputs to verify generated event mentions without encoding the audio again. On AudioSet, REVE removes 92.9% of label-unsupported mentions under a faithful-mention recall constraint. With fewer added parameters and no second audio-encoding pass, REVE achieves a reduction comparable to those of CED-Tiny and CED-Base. Its complete verification latency is about 1/18 of the CED-Base path. Results on controlled DESED mixtures and different target-model architectures further confirm the effectiveness of encoder-state reuse.
- Abstract(参考訳): 大規模な音声言語モデルでは、入力から外れた音響イベントを参照することができる。
別個のオーディオイベント検出器がこれらの言及を検証することができるが、それを行うには第2のオーディオエンコーダと別のフォワードパスが必要である。
対象モデルによって既に計算されている状態を利用する軽量な方法であるREVE(Reused Encoder States for Verifying Events)を提案する。
1つの読み出しはオーディオフレーム間でクラススコアを要約し、もう1つは連続する4つのフレーム間隔からプール状態を使用する。
クラス対応スコア融合は出力を結合して生成したイベント参照を検証するが、再度オーディオをエンコードする必要はない。
AudioSetでは、REVEは、忠実なリコール制約の下で、ラベルなしの言及の92.9%を削除している。
追加パラメータが少なく、第2のオーディオ符号化パスがないため、REVEはCED-TinyやCED-Baseに匹敵する縮小を実現している。
完全な検証レイテンシは、CED-Baseパスの約1/18である。
制御されたDESED混合物と異なるターゲットモデルアーキテクチャの結果は、エンコーダ-状態再利用の有効性をさらに確認する。
関連論文リスト
- MOSS-Audio Technical Report [80.01042232102883]
MOSS-Audioは、音声、環境音、音楽理解のための統一された音声言語モデルである。
音声キャプション、タイムアウェアな質問応答、タイムスタンプによる書き起こし、音声による推論をサポートする。
論文 参考訳(メタデータ) (2026-06-01T07:19:22Z) - Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding [54.82619273983179]
LALM(Large Audio-Language Models)は、オーディオに提示されるものを幻覚させる。
LALMの幻覚を軽減するためにオーディオ・アウェア・デコーディング(AAD)を導入する。
AADはコントラストデコーディングを使用して、トークン予測ログとオーディオコンテキストの有無を比較します。
論文 参考訳(メタデータ) (2025-06-08T17:36:50Z) - Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval [3.5570874721859016]
本稿では,複数の検索モデルを推定文を使わずに訓練する2段階の訓練手法を提案する。
第2段階では、これらのモデルによって予測される音声カプセル対応が予測ターゲットとして機能する。
提案手法をClosoV2とAudioCapsベンチマークで評価し, 自己蒸留条件が制限された場合でも, 検索性能が向上することを示す。
論文 参考訳(メタデータ) (2024-08-21T14:10:58Z) - Autoregressive Diffusion Transformer for Text-to-Speech Synthesis [39.32761051774537]
連続空間$mathbb Rd$のベクトル列として音響を符号化し、これらの列を自己回帰的に生成する。
高ビットレート連続音声表現は、ほとんど欠陥のない再構成を可能にし、我々のモデルは、ほぼ完璧な音声編集を実現できる。
論文 参考訳(メタデータ) (2024-06-08T18:57:13Z) - Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion
Models [65.18102159618631]
マルチモーダル生成モデリングは、テキスト・ツー・イメージとテキスト・ツー・ビデオ生成においてマイルストーンを生み出した。
高品質のテキストオーディオペアを備えた大規模データセットの欠如、長期連続的なオーディオデータのモデリングの複雑さ、という2つの主な理由から、オーディオへの適用は依然として遅れている。
本稿では,これらのギャップに対処する急激な拡散モデルを用いたMake-An-Audioを提案する。
論文 参考訳(メタデータ) (2023-01-30T04:44:34Z) - Automatic Audio Captioning using Attention weighted Event based
Embeddings [25.258177951665594]
本稿では,AACのための軽量(学習可能なパラメータが少ない)Bi-LSTM再帰層を有するエンコーダデコーダアーキテクチャを提案する。
AEDを用いた効率的な埋込み抽出器と時間的注意と拡張技術を組み合わせることで,既存の文献を超越できることを示す。
論文 参考訳(メタデータ) (2022-01-28T05:54:19Z) - Audio Captioning Transformer [44.68751180694813]
音声キャプションは、音声クリップの自然言語記述を自動的に生成することを目的としている。
ほとんどのキャプションモデルはエンコーダ-デコーダアーキテクチャに従っており、デコーダはエンコーダによって抽出された音声特徴に基づいて単語を予測する。
本稿では,エンコーダデコーダアーキテクチャに基づくフルトランスフォーマネットワークであるAudio Captioning Transformer (ACT)を提案する。
論文 参考訳(メタデータ) (2021-07-21T00:31:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。