論文の概要: SURE-Challenge: Evaluating Speech Evidence Before Speech-LLM Generation
- arxiv url: http://arxiv.org/abs/2608.27783v2
- Date: Mon, 31 Aug 2026 19:31:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 14:14:25.884773
- Title: SURE-Challenge: Evaluating Speech Evidence Before Speech-LLM Generation
- Title(参考訳): SURE-Challenge:音声LLM生成前における音声証拠の評価
- Authors: Mengzhe Geng,
- Abstract要約: 音声非サポート型リジェクション評価チャレンジ(SURE-Challenge)について
このベンチマークは、LibriSpeech由来の書き起こしと第一単語の質問応答を無音、色付きノイズ、合成トーン、ソース曖昧なバブルと組み合わせている。
リーク画面付き474例のSURE-Challengeテストセットでは、Qwen2-Audioは15/204の入力を拒否する一方、固定ルールは196/204を拒否し、サポートされた精度は変わらない。
- 参考スコア(独自算出の注目度): 8.345705067210861
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech LLMs are usually graded after they answer, although an operating system first has to decide whether to send a waveform to the model. We define the Speech-Unsupported Rejection Evaluation Challenge (SURE-Challenge) for this admission step. The benchmark pairs LibriSpeech-derived transcription and first-word question answering with unsupported silence, colored noise, synthetic tones, and source-ambiguous babble under disjoint source splits. Front-end ablations use Qwen2-Audio; the selected energy-plus-Whisper-score rule is then replayed before six speech/audio LLMs. On the leakage-screened 474-example SURE-Extended test set, raw Qwen2-Audio rejects 15/204 unsupported inputs, whereas the fixed rule rejects 196/204 and leaves supported accuracy unchanged. External evaluations qualify this result: Common Voice retention drops as the Whisper-score threshold is tightened, and no-speed babble gives 18 to 24 rejected clips out of 54 across regenerated seeds. The result identifies a pre-generation error mode missed by answer-only scoring.
- Abstract(参考訳): 音声LLMは通常、応答後にグレードされるが、オペレーティングシステムはまず、モデルに波形を送信するかどうかを決定する必要がある。
本稿では、この受け入れステップに対して、音声非サポート型拒絶評価チャレンジ(SURE-Challenge)を定義する。
ベンチマークは、LibriSpeech由来の書き起こしと第一単語の質問応答を無音、色付きノイズ、合成音、ソースとあいまいなバブルでペアリングする。
フロントエンドはQwen2-Audioを使用し、選択されたエネルギー+Whisper-scoreルールは6つの音声/オーディオ LLM の前に再生される。
リーク画面付き 474-example SURE-Extended test set では、生Qwen2-Audio は 15/204 の入力を拒否する一方、固定ルールは 196/204 を拒否し、サポートされた精度は変わらない。
共通音声保持はウィスパースコア閾値の締め付けによって低下し、ノンスピードバブルは再生種子54点中18点から24点のクリップを除去する。
その結果、回答のみのスコアリングで見逃された前世代エラーモードが特定される。
関連論文リスト
- Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does [27.909684871924004]
本稿では,テキストと音声アシスタントの統一評価プロトコルであるHear2Actを紹介する。
我々は、転写、音声、および関心状態アクセスに基づく意思決定を評価する。
語彙的証拠が不十分な場合には韻律が重要であることを示す。
論文 参考訳(メタデータ) (2026-08-20T00:16:36Z) - Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis [2.490194241610381]
音声配信におけるテキストの一致変化から, 脱獄能力がどの程度生じるかを検討する。
PJ-Breakは, 覚醒, 権威, 発話率を目標とした, 予め設定したブラックボックス評価プロトコルである。
全体として、一致したテキストによる音声の配信は、オーディオLLMの安全性評価において第一級の要素として扱われるべきである。
論文 参考訳(メタデータ) (2026-07-29T07:12:44Z) - Voice Memory for Agentic Speech Recognition [66.69623133635868]
エージェント音声認識のための推論専用スキームであるVoice Memoryを提案する。
同期的に、スコア付き例は、境界編集を通じてそのファイルを更新する。
10のHyPoradiseドメインにオープン修正器、Voice Memory、重み付き単語エラー率8.36%から7.52%の10のドメインがある。
論文 参考訳(メタデータ) (2026-07-29T02:42:56Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models [34.99721206808916]
音声モデルはしばしば、音声証拠が明確であっても、音声と矛盾するテキストに従う。
Gated Audio Counterfactual Logit Correction (GACL)を提案する。
厳格な5ppの忠実度ドロップの予算の下で、GACLは最高のコントラストベースラインよりも17.8ポイントのnAUCを改善している。
論文 参考訳(メタデータ) (2026-06-03T17:57:51Z) - Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition [9.131439623985028]
事前訓練された大規模言語モデルは、音声認識におけるタスク固有のデコーダを置き換える。
彼らのテキスト由来の先行性は、認識をより公平にするか、あるいは人口統計グループに偏っているか?
我々は,3世代にわたる9つのモデルを5つの人口動態軸にわたる約43,000発の発話で評価した。
論文 参考訳(メタデータ) (2026-04-23T04:40:58Z) - AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension [95.8442896569132]
AIR-Benchは,Large Audio-Language Models (LALM) の様々な種類の音声信号を理解し,テキスト形式で人間と対話する能力を評価する最初のベンチマークである。
その結果, GPT-4による評価と人間による評価との間には高い一貫性が認められた。
論文 参考訳(メタデータ) (2024-02-12T15:41:22Z) - TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head
Translation [54.155138561698514]
音声から音声への直接翻訳は、自己教師付き学習から得られる離散単位を導入することにより、高品質な結果が得られる。
既存の方法は常にカスケードに依存し、音声とテキストの両方を通して合成し、遅延やカスケードエラーを引き起こす。
本稿では,音声-視覚音声を他の言語で直接音声-視覚音声に翻訳できる,頭部翻訳モデルである textbfTransFace を提案する。
論文 参考訳(メタデータ) (2023-12-23T08:45:57Z) - End-to-end Whispered Speech Recognition with Frequency-weighted
Approaches and Pseudo Whisper Pre-training [130.56878980058966]
発声音声のエンド・ツー・エンド(E2E)認識に対するいくつかのアプローチを提案する。
我々は,比較的小型のTIMITコーパスを用いて,PER19.8%,CER44.4%の相対的な削減を実現した。
正規または擬似発声音声で事前訓練された優れたE2Eモデルがある限り、比較的小さな発声音声は、合理的に優れたE2E発声音声認識器を得るのに十分である。
論文 参考訳(メタデータ) (2020-05-05T07:08:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。