論文の概要: CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation
- arxiv url: http://arxiv.org/abs/2603.19615v1
- Date: Fri, 20 Mar 2026 03:46:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.982186
- Title: CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation
- Title(参考訳): CAFスコア:レファレンスフリーオーディオキャプション評価のためのLALMを用いたCLAPの校正
- Authors: Insung Lee, Taeyoung Jeong, Haejun Yoo, Du-Seong Chang, Myoung-Wan Koo,
- Abstract要約: CAF-Scoreは、Contrastive Language-Audio Pretrainingを校正する参照フリーメトリックである。
BRACEベンチマーク実験により,本手法が人間の判断と最も相関性が高いことを示す。
- 参考スコア(独自算出の注目度): 8.159381253357127
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Large Audio-Language Models (LALMs) have advanced audio captioning, robust evaluation remains difficult. Reference-based metrics are expensive and often fail to assess acoustic fidelity, while Contrastive Language-Audio Pretraining (CLAP)-based approaches frequently overlook syntactic errors and fine-grained details. We propose CAF-Score, a reference-free metric that calibrates CLAP's coarse-grained semantic alignment with the fine-grained comprehension and syntactic awareness of LALMs. By combining contrastive audio-text embeddings with LALM reasoning, CAF-Score effectively detects syntactic inconsistencies and subtle hallucinations. Experiments on the BRACE benchmark demonstrate that our approach achieves the highest correlation with human judgments, even outperforming reference-based baselines in challenging scenarios. These results highlight the efficacy of CAF-Score for reference-free audio captioning evaluation. Code and results are available at https://github.com/inseong00/CAF-Score.
- Abstract(参考訳): LALM(Large Audio-Language Models)には高度な音声キャプションがあるが,ロバストな評価は依然として難しい。
Contrastive Language-Audio Pretraining (CLAP)ベースのアプローチは、構文上の誤りや細かい詳細をしばしば見落としている。
CAF-Scoreは,CLAPの粗粒度セマンティックアライメントを,LALMの細粒度理解と構文認識とを校正する参照フリーメトリックである。
対照的な音声テキストの埋め込みとLALM推論を組み合わせることで、CAF-Scoreは構文上の矛盾や微妙な幻覚を効果的に検出する。
BRACEベンチマーク実験により,本手法は人間の判断と最も相関性が高いこと,さらには難解なシナリオにおいて基準ベースラインよりも優れていることを示した。
これらの結果から,CAF-Scoreが参照なし音声キャプション評価に有効であることが示唆された。
コードと結果はhttps://github.com/inseong00/CAF-Score.comで公開されている。
関連論文リスト
- How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation [97.0235251827591]
大規模言語モデル (LLM) は,Large Audio Language Models (LALM) の知識バックボーンとして広く利用されている。
テキストのみの事前学習によって符号化される聴覚知識の量と、それが下流のパフォーマンスに与える影響について検討する。
その結果,家族間で聴覚知識が大きく異なり,テキストのみの結果が音響性能と強く相関していることが判明した。
論文 参考訳(メタデータ) (2026-03-19T17:50:07Z) - SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models [49.313324100819955]
信号埋め込みエネルギー (Signal Embedding Energy, SEE) は、LALM入力に対する雑音強度の影響を定量化する手法である。
SEEはLALM性能と強い相関を示し,0.98。
本稿では,LALMにおけるノイズ定量化のための新しい指標を提案し,実環境におけるロバスト性向上のためのガイダンスを提供する。
論文 参考訳(メタデータ) (2026-01-12T08:57:55Z) - BRACE: A Benchmark for Robust Audio Caption Quality Evaluation [23.704921982469063]
BRACEは、参照なし環境でのオーディオアライメント品質を評価するために設計された新しいベンチマークである。
BRACEは、細かな字幕比較のためのBRACE-Mainと微妙な幻覚内容を検出するBRACE-Hallucinationの2つのサブベンチマークから構成される。
BRACEベンチマークを用いて,各種CLAPモデルでCLAPScoreを試験し,複数のLALMを評価した。
論文 参考訳(メタデータ) (2025-12-11T08:09:24Z) - Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples [55.2480439325792]
近年の音声対応大型言語モデル(ALLM)により、音声入力の処理と理解が可能になった。
これらのモデルは、しばしば既存の音響イベントを幻覚させ、現実の応用における信頼性を低下させる。
LISTENは、現在と欠落した音を識別するallMsの能力を向上するコントラスト的な訓練法である。
論文 参考訳(メタデータ) (2025-05-20T15:44:01Z) - Adapting Pretrained Language Models for Citation Classification via Self-Supervised Contrastive Learning [13.725832389453911]
サイテーション分類は学術的な分析に欠かせない。
先行研究は、引用分類に基づく微調整事前学習言語モデル(PLM)を示唆している。
我々はこれらの課題を克服するためにPLMに適応する新しいフレームワーク、Citssを提案する。
論文 参考訳(メタデータ) (2025-05-20T15:05:27Z) - CLAIR-A: Leveraging Large Language Models to Judge Audio Captions [73.51087998971418]
機械生成オーディオキャプションの評価は、様々な要因を検討する必要がある複雑なタスクである。
本稿では,大規模言語モデルのゼロショット機能を活用するシンプルで柔軟なCLAIR-Aを提案する。
我々の評価では、CLAIR-Aは従来のメトリクスと比較して品質の人的判断を良く予測する。
論文 参考訳(メタデータ) (2024-09-19T17:59:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。