論文の概要: Broadening Uncertainty Estimation for Audio Question Answering Across Methods, Formats, and Inputs
- arxiv url: http://arxiv.org/abs/2609.28879v1
- Date: Thu, 24 Sep 2026 00:58:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.624609
- Title: Broadening Uncertainty Estimation for Audio Question Answering Across Methods, Formats, and Inputs
- Title(参考訳): 音声質問応答手法, フォーマット, 入力に対する不確実性評価の拡充
- Abstract要約: オーディオ言語モデルは、オーディオによって支持されない自信ある回答を生成することができる。
4つのオープンウェイトモデルと5つのオーディオQAベンチマークで,確率ベース,サンプリングベース,自己検証,明度,コントラストの測定値を比較した。
- 参考スコア(独自算出の注目度): 11.862176451777286
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio-language models can produce confident answers unsupported by the audio, motivating uncertainty estimates that identify unreliable responses. We compare probability-based, sampling-based, self-verification, evidential, and contrastive measures across four open-weight models and five audio QA benchmarks. In multiple-choice evaluation, first-token measures are strongest overall, with top-1 probability achieving a mean AUROC of .740, compared with .708 for ten-sample discrete semantic entropy, while requiring no additional model calls. Across four benchmarks, shifting from multiple-choice to open-ended evaluation lowers mean accuracy from 57.6% to 36.6%, yet uncertainty remains predictive of errors: semantic entropy, maximum token entropy, and semantic agreement achieve mean AUROCs of .697, .694, and .693, respectively. To test whether uncertainty reflects the evidence available to answer the question, we perform input ablations that remove either the audio or the question. Across top-1 confidence, entropy, and sampling-based measures, removing audio reduces error-detection AUROC by .101 on average, compared with .010 when removing the question. Together, these results establish efficient uncertainty baselines and show that uncertainty in audio-language models depends substantially more on available audio evidence than on question text.
- Abstract(参考訳): オーディオ言語モデルは、信頼できない応答を識別する不確実性推定を動機付け、オーディオによって支持される自信ある回答を生成することができる。
4つのオープンウェイトモデルと5つのオーディオQAベンチマークで,確率ベース,サンプリングベース,自己検証,明度,コントラストの測定値を比較した。
多重選択評価では、トップ1の確率は平均 .740 であり、10サンプルの離散的セマンティックエントロピーでは .708 であり、追加のモデルコールは不要である。
4つのベンチマークで、多重選択からオープンエンド評価へのシフトにより、平均精度は57.6%から36.6%に低下するが、セマンティックエントロピー、最大トークンエントロピー、セマンティックアライアンスはそれぞれ.697、.694、.693の平均AUROCを達成している。
不確かさが質問に答えられる証拠を反映しているかどうかを調べるために、音声または質問を除去する入力アブレーションを実行する。
トップ1の信頼度、エントロピー、サンプリングに基づく測定、オーディオの除去は平均で.101の誤差検出AUROCを減少させる。
これらの結果から, 音声モデルにおける不確実性は, 質問文よりも, 利用可能な音声証拠に大きく依存していることが示唆された。
関連論文リスト
- Likelihood Ranking doesn't Scale Like Prompting in LLMs [91.56564968539271]
多重選択QAでは、質問セットと回答セットに標準確率ベースのスコアがまだ条件付けられている。
我々は,同じ質問対から構築された宣言文の確率ランキングに基づく補完的プロトコルについて検討する。
論文 参考訳(メタデータ) (2026-09-24T11:16:53Z) - Truth for Believable AI: Expressed Doubt, Provenance, and Belief Revision as an Engineerable Stance [0.0]
定型言語モデル上での動作層として,不確実性,先入観を意識したアサーション,明示的信念のリビジョンを実装できるかどうかを検証した。
合成モデルとQwen2.5-0.5B-インストラクタを用いて,機械的に評価したマルチセッションベンチマークを用いて評価を行った。
論文 参考訳(メタデータ) (2026-09-22T11:34:53Z) - From Answers to Interpretations: Rethinking Ambiguity-Induced Aleatoric Uncertainty Estimation in LLMs [23.112451416460825]
言語タスクでは、そのようなアレターの不確実性の中央の源は入力のあいまいさまたは不明瞭さである。
既存の分解法では、入力の複数の明細化を生成し、各明細化の下で解答のモデルをクエリし、その結果の回答を比較することで、アレタリック不確かさを推定する。
本稿では,この曖昧性によって引き起こされる成分を,説明可能な解釈の空間から直接推定する,明確化のみのアプローチを提案する。
論文 参考訳(メタデータ) (2026-09-03T23:00:52Z) - Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs [4.476374205849672]
ブラックボックス言語モデルの言語的信頼度は、検索ルーティングのための実用的な信号として機能する。
6つのQAベンチマーク、3つのモデルファミリー、3つの検索ポリシーで27,000のポリシーインスタンスを評価した。
論文 参考訳(メタデータ) (2026-07-28T11:30:25Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models [54.041320081289996]
音声対応大言語モデル(ALLM)における不確実性推定に関する最初の系統的研究について述べる。
予測エントロピー、長さ正規化エントロピー、意味エントロピー、個別意味エントロピー、P(True)を含む5つの代表的な手法をベンチマークする。
まず、意味レベルと検証ベースの手法は、一般的な音声推論ベンチマークにおけるトークンレベルベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-04-28T12:56:22Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Probabilistic Modeling of Disparity Uncertainty for Robust and Efficient Stereo Matching [61.73532883992135]
本稿では,新しい不確実性を考慮したステレオマッチングフレームワークを提案する。
我々はベイズリスクを不確実性の測定として採用し、データを別々に見積もり、不確実性をモデル化する。
論文 参考訳(メタデータ) (2024-12-24T23:28:20Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - Word-Sequence Entropy: Towards Uncertainty Estimation in Free-Form Medical Question Answering Applications and Beyond [52.246494389096654]
本稿ではワードシーケンスエントロピー(WSE)を紹介し,単語レベルとシーケンスレベルの不確実性を校正する手法を提案する。
We compare WSE with six baseline method on five free-form medical QA datasets, using 7 popular large language model (LLMs)。
論文 参考訳(メタデータ) (2024-02-22T03:46:08Z) - Uncertainty-aware Language Modeling for Selective Question Answering [107.47864420630923]
本稿では,不確実性を考慮したLLMを生成するLLM変換手法を提案する。
我々のアプローチはモデルとデータに依存しず、計算効率が高く、外部モデルやシステムに依存しない。
論文 参考訳(メタデータ) (2023-11-26T22:47:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。