論文の概要: Audio LLMs Know When They Can't Hear You
- arxiv url: http://arxiv.org/abs/2609.30625v2
- Date: Mon, 28 Sep 2026 18:03:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.542557
- Title: Audio LLMs Know When They Can't Hear You
- Title(参考訳): 耳に聞こえない音をLLMが教えてくれる
- Abstract要約: 本研究では,Audio LLMが自身の書き起こしが信頼できないことを認識できるかどうかを検討する。
凍結したオーディオエンコーダによって抽出された表現を操作する軽量な信頼性予測器を考案する。
- 参考スコア(独自算出の注目度): 23.69215397391575
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Audio large language models allow users to interact with the model through speech. When an input recording is too degraded, the model may misinterpret the user's query and respond based on an incorrect transcription. In this paper, we study model-conditional transcription reliability: whether an Audio LLM can recognize when its own transcription is unreliable. We first prompt the Audio LLM to assess whether its own transcription would be reliable, and find that the model is a poor judge of its own transcription reliability: in most cases, it predicts that its transcription will be reliable. We find that existing approaches, including speech quality predictors, audio LLM generation uncertainty, and transcript-conditioned WER estimation, provide limited signals for detecting transcription failures. In contrast, we discover that transcription reliability is strongly represented in the model's audio-encoder representations. Based on this observation, we devise a lightweight reliability predictor that operates on representations extracted by the frozen audio encoder and predicts the reliability class before generation. The reliability predictor can trigger a clarification request from the user when their voice query is predicted to be unreliable, while allowing reliable queries to proceed without modifying the underlying Audio LLM. Our predictor achieves 81.10% in-domain and 78.09% cross-domain macro-F1 scores, outperforming the strongest baselines by 10.33 and 11.93 points, respectively. Finally, we show that reliability labels can transfer across Audio LLM families, and that transfer performance is closely related to the alignment of their model-specific reliability boundaries.
- Abstract(参考訳): オーディオ大言語モデルは、ユーザーが音声でモデルと対話することを可能にする。
入力記録が劣化しすぎると、そのモデルはユーザーのクエリを誤って解釈し、誤った書き起こしに基づいて応答する。
本稿では,Audio LLMが自身の書き起こしが信頼できないことを認識できるかどうか,モデル条件による書き起こしの信頼性について検討する。
まず最初に、Audio LLMに、自身の転写が信頼できるかどうかを判断するよう促し、そのモデルが自身の転写信頼性の判断に乏しいことに気付き、ほとんどの場合、その転写が信頼できると予測する。
音声品質予測器,LLM生成の不確実性,および書き起こし条件付きWER推定などの既存の手法は,文字誤りを検出するための限られた信号を提供する。
対照的に、転写信頼性はモデルのオーディオエンコーダ表現に強く表される。
そこで本研究では,凍結したオーディオエンコーダによって抽出された表現を操作する軽量な信頼性予測器を考案し,生成前の信頼性クラスを予測する。
信頼性予測器は、音声クエリが信頼できないと予測された場合に、ユーザからの明確化要求をトリガーし、基盤となるAudio LLMを変更することなく、信頼性の高いクエリを進行させることができる。
予測器はドメイン内81.10%、クロスドメインマクロF1スコア78.09%を達成し、それぞれ10.33点、11.93点で最強のベースラインを上回りました。
最後に、信頼性ラベルはAudio LLMファミリ間で転送可能であることを示し、転送性能はモデル固有の信頼性境界のアライメントと密接に関連していることを示す。
関連論文リスト
- Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation [20.39535344813245]
予測確率のような内部信号に基づく教師なしのアプローチは、正確性ではなく選択肢間の確実性を反映しているため、誤解を招く可能性がある。
我々は,これらの欠点を伴わずにLLM毎の信頼度を抽出し,その信頼性をモデルの内部信号の確実性と比較する5つの言語化手法を考案した。
内部的手法と言語的手法の相関はほとんど見つからない。
論文 参考訳(メタデータ) (2026-06-15T19:27:47Z) - RAS: a Reliability Oriented Metric for Automatic Speech Recognition [25.75084999899914]
本稿では, ASR モデルが不確実なセグメントを明示的に排除できる,無意味なフレームワークを提案する。
本実験は、競合精度を維持しつつ、転写信頼性を大幅に改善したことを示す。
論文 参考訳(メタデータ) (2026-04-27T10:11:08Z) - Can Large Language Models Express Uncertainty Like Human? [71.27418419522884]
我々は,人間に注釈を付けた信頼スコアを持つヘッジ式の最初の多種多様な大規模データセットをリリースする。
現代大言語モデルにまたがる言語信頼に関する最初の体系的研究を行う。
論文 参考訳(メタデータ) (2025-09-29T02:34:30Z) - Can LLMs Detect Their Confabulations? Estimating Reliability in Uncertainty-Aware Language Models [24.72990207218907]
LLM(Large Language Models)は、畳み込み(confabulation)として知られる、流動的だが不正なコンテンツを生成する傾向にある。
本研究では、文脈内情報がモデル行動にどのように影響するか、LLMが信頼できない応答を識別できるかを検討する。
論文 参考訳(メタデータ) (2025-08-11T16:12:36Z) - MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs [66.14178164421794]
メタファイト(MetaFaith)は、ヒトのメタ認知に触発された新規なプロンプトベースのキャリブレーション手法である。
MetaFaithは多種多様なモデルやタスク領域における忠実なキャリブレーションを強力に改善し、忠実度を最大61%向上させることができることを示す。
論文 参考訳(メタデータ) (2025-05-30T17:54:08Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z) - It's Never Too Late: Fusing Acoustic Information into Large Language
Models for Automatic Speech Recognition [70.77292069313154]
大規模言語モデル(LLM)は、自動音声認識(ASR)出力の上の生成誤り訂正(GER)に成功することができる。
本研究では,不確実性認識ダイナミックフュージョン (UADF) と呼ばれる新しい遅延融合解によって予測された転写を生成する前に,音響情報を注入することにより,そのような制限を克服することを目的とする。
論文 参考訳(メタデータ) (2024-02-08T07:21:45Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。