論文の概要: Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation
- arxiv url: http://arxiv.org/abs/2607.13477v1
- Date: Wed, 15 Jul 2026 06:10:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.668812
- Title: Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation
- Title(参考訳): 大規模音声モデルにおける音声評価のためのプロトコルレベルショートカットの検討
- Authors: Joonyong Park, David M. Chan, Yuki Saito, Hiroshi Saruwatari,
- Abstract要約: 大規模な音声言語モデル(LALM)は、音声評価のための自動判断器としてますます使われている。
人間の評価に対する高い合意は、彼らの判断がオーディオに根拠があることを保証するものではない。
LALMにおけるこのようなプロトコルレベルのショートカットを3つの共通デプロイメントプロトコルで評価する。
- 参考スコア(独自算出の注目度): 35.33202492428442
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large audio-language models (LALMs) are increasingly used as automatic judges for speech evaluation. However, high agreement with human ratings does not guarantee that their verdicts are grounded in the audio. A judge may instead rely on specialist labels or reference data supplied by the evaluation protocol itself, taking a shortcut in place of listening to the audio. In this paper, we audit such protocol-level ``shortcuts'' in LALM judges across three common deployment protocols: feature-blueprint judging, where the audio is replaced by a structured text description of acoustic features, reference-conditioned judging, and pairwise A/B comparison. Across six judges and four attributes, we find that several LALMs rely on protocol-level shortcuts. For example, in feature-blueprint judging, incorrect specialist labels reduce five judges' emotion accuracy to 0.10 or below, and in concatenated A/B comparisons, Qwen3-Omni-Thinking often picks the same slot regardless of order swaps. These results indicate that aggregate agreement can overstate the validity of LALM judges unless the model and the evaluation protocol are assessed jointly, and that each model-protocol pair should be evaluated with a matched shortcut probe.
- Abstract(参考訳): 大規模な音声言語モデル(LALM)は、音声評価のための自動判断器としてますます使われている。
しかし、人間の評価に対する高い合意は、その判断が音声に根拠があることを保証するものではない。
裁判官は代わりに、評価プロトコル自体によって提供される専門ラベルや参照データに依存して、オーディオを聴く代わりにショートカットを取ることができる。
本稿では,LALM におけるこのようなプロトコルレベルの `shortcuts' を,音声を音響特徴の構造化テキスト記述や基準条件判定,ペアワイズ A/B 比較に置き換えた特徴青写真判定という,3つの一般的な展開プロトコルにまたがって評価する。
6人の審査員と4人の属性のうち、複数のLALMがプロトコルレベルのショートカットに依存していることがわかった。
例えば、特徴青写真では、不正確な専門家ラベルが5人の裁判官の感情の正確さを0.10以下に減らし、統合されたA/B比較では、Qwen3-Omni-Thinkingは注文スワップに関係なく、しばしば同じスロットを選択する。
これらの結果は,モデルと評価プロトコルが共同で評価されない限り,集合的合意はLALM審査員の妥当性を過大に評価でき,各モデルとプロトコールのペアは一致したショートカットプローブで評価されるべきであることを示唆している。
関連論文リスト
- ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge [30.520810407664072]
ParaPairAudioBenchは、5つのパラ言語的次元(スタイル、レート、強調、年齢、ジェンダー)にわたる5,175のオーディオペアのペアベンチマークである。
実験によると、現在のLALMの審査員は平均で32%の差で人間の判断に遅れており、厳しい校正の失敗を示している。
論文 参考訳(メタデータ) (2026-06-23T14:43:43Z) - Does the Judge Prefer English? Evaluating Language-Switching Invariance in LLM-as-a-Judge [0.0]
LLMBar応答ペアアイテムを英語、中国語、中国語に切り替えた変種に変換する軽量なメタ評価プロトコルを提案する。
信頼できる裁判官は、ラベルアクセシブル言語変換の下でその嗜好を維持するべきである。
モデル全体では、中国語と言語に精通したプレゼンテーションは、英語と比較して10.7-14.4%の好みのフリップを誘導し、すべての審査員は英語で最高の精度を達成している。
論文 参考訳(メタデータ) (2026-06-12T08:59:26Z) - SAM Audio Judge: A Unified Multimodal Framework for Perceptual Evaluation of Audio Separation [52.468945848774844]
本稿では,人間の介入なしに音声の分離を評価できる自動システムの必要性に対処する。
提案した評価指標であるSAM Audio Judge (SAJ) は, マルチモーダルな細粒度参照自由度尺度である。
SAJは3つのオーディオドメイン(音声、音楽、一般的な音声イベント)と3つのインプット(テキスト、視覚、スパン)をサポートし、4つの異なる評価次元をカバーする。
論文 参考訳(メタデータ) (2026-01-27T15:29:02Z) - Hearing Between the Lines: Unlocking the Reasoning Power of LLMs for Speech Evaluation [19.92868268408954]
大言語モデル(LLM)の判断は、強い推論能力を示すが、テキストコンテンツに限定される。
提案するTRACEは,LLM審査員が音質を判断し,費用対効果と人間対応のS2S評価を実現するための新しいフレームワークである。
HCoTアノテーションとTRACEフレームワークをリリースし、スケーラブルでヒューマンアラインなS2S評価を可能にします。
論文 参考訳(メタデータ) (2026-01-20T08:57:02Z) - Validating LLM-as-a-Judge Systems under Rating Indeterminacy [65.137380612741]
評価の不確定性の下でLLM-as-a-judgeシステムを検証するための枠組みを提案する。
本研究では, 強制選択評価指示に応答する際の評価の不確定性を人間とLLMがどう解決するかの相違が, 偏見の検証に大きく寄与することを示した。
論文 参考訳(メタデータ) (2025-03-07T22:09:47Z) - CLAIR-A: Leveraging Large Language Models to Judge Audio Captions [73.51087998971418]
機械生成オーディオキャプションの評価は、様々な要因を検討する必要がある複雑なタスクである。
本稿では,大規模言語モデルのゼロショット機能を活用するシンプルで柔軟なCLAIR-Aを提案する。
我々の評価では、CLAIR-Aは従来のメトリクスと比較して品質の人的判断を良く予測する。
論文 参考訳(メタデータ) (2024-09-19T17:59:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。