論文の概要: Towards Quantifying Benchmark Optimization in ASR Models
- arxiv url: http://arxiv.org/abs/2608.19936v1
- Date: Thu, 20 Aug 2026 11:54:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.557623
- Title: Towards Quantifying Benchmark Optimization in ASR Models
- Title(参考訳): ASRモデルにおけるベンチマーク最適化の定量化に向けて
- Authors: Theo Lebryk, David Ayllon, Alice Baird, Jakub Piotr Cłapa, Jens Madsen, Panagiotis Tzirakis,
- Abstract要約: その結果,高性能モデルでは,汎用的な書き起こし能力の向上を反映することなく,ベンチマーク性能を向上できることを示す。
最上位のオープンソースモデルは、関連するオーディオが矛盾している場合や、マスクされている場合、曖昧な場合にも、冗長な参照書き起こしを出力する。
- 参考スコア(独自算出の注目度): 6.368891551783367
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Public benchmarks are important measures of Automatic Speech Recognition (ASR) model capabilities. However, by nature of being public, there is risk of models being optimized for these benchmarks in ways that do not generalize well to real-world data. We present a methodology for quantifying benchmark optimization, focusing on cases where the audio underdetermines the reference transcript. We identify three families of behavioral probes that reveal models' capabilities of reproducing benchmark reference spans despite underdetermined audio: reference disagreement, masked-number recovery, and orthographic switching. We find that the highest-scoring open source models output verbatim reference transcript spans even when the relevant audio is contradictory, masked, or ambiguous. Using a variety of mechanistic probes, we show that models respond to narrow acoustic cues to override the faithful representation of the audio in favor of a benchmark-optimized policy. We show the benchmark-optimized behavior can be causally manipulated via low-rank linear steering or simply appending audio to the end of a segment in some cases. Overall, our results indicate that high-performing models exhibit benchmark-conditioned behaviors that can inflate benchmark performance without reflecting improved general-purpose transcription ability.
- Abstract(参考訳): 公的なベンチマークは、自動音声認識(ASR)モデル機能の重要な指標である。
しかし、一般には、これらのベンチマークにモデルが最適化されるリスクがあり、実際のデータにうまく当てはまらない。
本稿では,音声が参照書き起こしを過小評価する事例に着目し,ベンチマーク最適化の定量化手法を提案する。
我々は,参照不一致,マスク数回復,正書法スイッチングの3種類の行動プローブを同定し,ベンチマーク参照を再現するモデルの能力を明らかにする。
最上位のオープンソースモデルは、関連するオーディオが矛盾している場合や、マスクされている場合、曖昧な場合にも、冗長な参照書き起こしを出力する。
各種メカニスティックプローブを用いて, モデルが狭い音響的手がかりに応答し, 音響の忠実な表現をオーバーライドし, ベンチマーク最適化ポリシーを優先することを示す。
ベンチマークに最適化された動作は、低ランクの線形ステアリングや、セグメントの端に音声を付加するだけで因果的に操作できることを示す。
以上の結果から,高性能モデルでは,汎用的な書き起こし能力の向上を反映することなく,ベンチマーク性能を向上することができることが示唆された。
関連論文リスト
- VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation [79.34043102155964]
共同ビデオオーディオ生成のためのチェーン・オブ・オムニ・リワードモデルであるVA-Judgerを提案する。
VA-Judgerは,ドメイン内評価とドメイン外評価の両方において,ヒトの嗜好を予測する上で,指標ベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-08-19T06:53:14Z) - IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation [85.56193980646981]
命令追従のための総合的メタ評価ベンチマークであるIF-RewardBenchを提案する。
各命令に対して、複数の応答間の全てのペアの選好を含む選好グラフを構築する。
IF-RewardBenchの実験は、現在の審査モデルに重大な欠陥を呈している。
論文 参考訳(メタデータ) (2026-03-05T02:21:17Z) - Aligning Language Model Benchmarks with Pairwise Preferences [15.427340427081843]
ベンチマークアライメントを導入し、モデルパフォーマンスに関する限られた量の情報を使用して、オフラインベンチマークを自動的に更新します。
次に、ベンチマーク問題に対する優先順の重み付けを学習するBenchAlignを提案する。
我々の実験は、一致したベンチマークが、異なるサイズであっても、人間の好みのモデルに従って、正確に、見つからないモデルをランク付けできることを示している。
論文 参考訳(メタデータ) (2026-02-02T23:11:09Z) - Learning More from Less: Unlocking Internal Representations for Benchmark Compression [37.69575776639016]
異種隠蔽状態を統一潜在空間に整列させて代表コアセットを構成するREPCOREを導入する。
5つのベンチマークと200以上のモデルの実験は、ランキングの相関と推定精度において、出力ベースラインよりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-01-31T13:11:39Z) - VocSim: A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio [1.0791267046450075]
VocSimは、凍結埋め込みの固有の幾何学的アライメントを探索するトレーニング不要のベンチマークである。
VocSimは、人間のスピーチ、動物の発声、環境音にまたがる19のコーパスから125万のソースクリップを集約する。
論文 参考訳(メタデータ) (2025-12-10T22:13:12Z) - Uncovering Competency Gaps in Large Language Models and Their Benchmarks [11.572508874955659]
本稿では,スパースオートエンコーダ(SAE)を用いて,両方のギャップを自動的に発見する手法を提案する。
我々は、モデルが、サイコファンティックな振る舞いとは対照的な概念に一貫して劣っていることを発見した。
提案手法は,ベンチマークスコアの概念レベルの分解を可能にするため,評価のための表現的アプローチを提供する。
論文 参考訳(メタデータ) (2025-12-06T17:39:47Z) - $C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction [80.57232374640911]
我々はMask-And-Recover (MAR)と呼ばれるモデルに依存しない戦略を提案する。
MARは、モダリティ間およびモダリティ間コンテキスト相関を統合し、抽出モジュール内の大域的推論を可能にする。
各サンプルの難易度を向上するために, 精細信頼スコア(FCS)モデルを導入する。
論文 参考訳(メタデータ) (2025-04-01T13:01:30Z) - A Study on Speech Enhancement Based on Diffusion Probabilistic Model [63.38586161802788]
雑音信号からクリーンな音声信号を復元することを目的とした拡散確率モデルに基づく音声強調モデル(DiffuSE)を提案する。
実験結果から、DiffuSEは、標準化されたVoice Bankコーパスタスクにおいて、関連する音声生成モデルに匹敵する性能が得られることがわかった。
論文 参考訳(メタデータ) (2021-07-25T19:23:18Z) - Rethinking Evaluation in ASR: Are Our Models Robust Enough? [30.114009549372923]
一般に、残響と付加音の増補により、ドメイン間の一般化性能が向上することを示す。
ベンチマークを十分に使うと、平均単語誤り率(WER)のパフォーマンスが実世界のノイズの多いデータのパフォーマンスに良いプロキシを提供することを示した。
論文 参考訳(メタデータ) (2020-10-22T14:01:32Z) - Real Time Speech Enhancement in the Waveform Domain [99.02180506016721]
本稿では,ラップトップCPU上でリアルタイムに動作する生波形を用いた因果音声強調モデルを提案する。
提案モデルは、スキップ接続を持つエンコーダデコーダアーキテクチャに基づいている。
静止ノイズや非定常ノイズを含む様々な背景ノイズを除去することができる。
論文 参考訳(メタデータ) (2020-06-23T09:19:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。