論文の概要: The Computational Basis of Confidence in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.12447v1
- Date: Tue, 14 Jul 2026 07:24:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.075312
- Title: The Computational Basis of Confidence in Large Language Models
- Title(参考訳): 大規模言語モデルにおける信頼の計算的基礎
- Abstract要約: 統計的決定信頼度を用いて言語モデルにおける信頼度を研究する。
回答ロジットは、潜在決定変数の単調な読み出しとして振る舞うことを示す。
これらの結果は、SDCを生物学的および人工知能の信頼性を研究するための統一的な枠組みとして確立している。
- 参考スコア(独自算出の注目度): 2.8220151940446425
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable confidence -- the probability that a model's own answer is correct -- is essential for the trustworthy deployment of language models. Existing work has largely evaluated confidence by how well it predicts correctness and whether it is calibrated, leaving open a more fundamental question: what does the confidence signal itself represent? Answer logits may reflect a latent decision variable sufficient to compute normative confidence, or instead a heuristic preference signal that combines the available evidence in a non-Bayesian manner. We address this using statistical decision confidence (SDC), a normative framework from computational neuroscience. Treating the answer-logit difference (LD) as a candidate readout of the latent decision variable, we test the qualitative signatures predicted by SDC. Across three perceptual discrimination tasks and a memory-based decision task, spanning three multimodal non-reasoning models and one reasoning model, LD satisfied these signatures -- including the diagnostic correct/error folded-X pattern -- showing that, in these settings, answer logits behave as monotonic readouts of a latent decision variable rather than heuristic preference scores. In complex visual reasoning, LD continued to predict correctness beyond objective task difficulty, but the full geometric signatures of SDC were absent, illustrating the current boundary of the framework when explicit normative process models are unavailable. These results provide a computational account of confidence in multimodal language models, delineate when answer logits behave as readouts of a latent decision variable, and establish SDC as a unifying framework for studying confidence across biological and artificial intelligence.
- Abstract(参考訳): 信頼できる自信 -- モデル自身の回答が正しい確率 -- は、言語モデルの信頼できるデプロイに不可欠です。
既存の作業は、どの程度の正確さを予測し、校正されているかを判断し、より基本的な質問を開いている。
回答ロジットは、規範的信頼を計算するのに十分な潜在的な決定変数を反映するかもしれないし、非ベイズ的な方法で利用可能な証拠を組み合わせるヒューリスティックな選好信号である。
計算神経科学の規範的枠組みである統計的決定信頼度(SDC)を用いてこの問題に対処する。
SDC が予測する定性的なシグネチャを検証し, 解答・解答差(LD)を潜在決定変数の候補読み出しとして扱う。
3つの知覚的識別タスクとメモリベースの決定タスクで、3つのマルチモーダルな非推論モデルと1つの推論モデルにまたがるLDは、これらのシグネチャを満足させた。
複雑な視覚的推論では、LDは目的的なタスクの難易度を超える正確さを予測し続けたが、SDCの完全な幾何学的シグネチャが欠如しており、明示的な規範的プロセスモデルが利用できない場合、フレームワークの現在の境界が示されていた。
これらの結果から,マルチモーダル言語モデルにおける信頼性の計算的説明,回答ロジットが潜在決定変数の読み出しとして振る舞う際の記述,およびSDCを生物学的および人工知能の信頼性を研究するための統一的な枠組みとして確立する。
関連論文リスト
- DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning [2.867517731896504]
ブラックボックスの言語的信頼度は、大きな言語モデルでは校正が難しい。
本稿では,ディリクレ証拠集約法であるDirEAGを提案する。
論文 参考訳(メタデータ) (2026-08-21T03:48:25Z) - Reported Confidence in LLMs Tracks Commitment More Than Correctness [0.7783842564949857]
信頼とは、選択された答えが正しい確率の見積もりである。
我々は、知覚的意思決定の神経科学から2段階の棄権パラダイムを用いてこれを検証した。
言語的自信は、その答えが正しいかどうかよりも、コミット/アビデンスの判断がかなり良いと予測した。
論文 参考訳(メタデータ) (2026-06-28T16:39:18Z) - Latent Confidence Alignment for LLM Self-Assessment [8.73168195475753]
本稿では,モデル能力と項目難易度を指標として,モデル自己評価と潜在誤り確率との整合性を測定するためのモデルベース潜在能力フレームワークとメタ認知的視点を提案する。
20モデルを用いた医療領域データセットの実験は,提案手法がモデル能力に影響を与えることなく自己評価品質を向上させることを示す。
論文 参考訳(メタデータ) (2026-06-20T08:13:31Z) - LLMs Show No Signs Of Individuated Metacognition [0.023227405857540805]
20大言語モデルから二項信頼判断を分解する。
信頼性が異なる2つのモデルも性能が異なるかどうかを問う。
いずれの検査領域においても,有意な弁別メタ認知の証拠は見つからない。
論文 参考訳(メタデータ) (2026-05-22T23:54:33Z) - Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution [12.955460962298588]
我々は、生成した推論トレースのみに基づいてステップレベルの信頼性を割り当てる、クローズドソース LLM のためのフレームワークである Stepwise Confidence Attribution (SCA) を紹介する。
SCAは、推論エラーと強く相関する低信頼のステップを確実に特定します。
ステップレベルの信頼を利用して自己補正を導くことで、回答レベルのフィードバックよりも最大で13.5%の修正成功率が向上する。
論文 参考訳(メタデータ) (2026-05-19T00:57:51Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - Sensitivity Uncertainty Alignment in Large Language Models [0.0]
逆入力およびあいまい入力下での大規模言語モデルの故障を解析するためのフレームワークを提案する。
我々はスカラースコア SUA_theta(x) を定義し、分布感度と予測エントロピーの差を捉える。
我々は,一貫性の正則化とエントロピーアライメントを組み合わせたトレーニング手法SUA-TRと,より安全な推論のための禁制ルールを導入する。
論文 参考訳(メタデータ) (2026-04-21T17:53:12Z) - On Calibration of Large Language Models: From Response To Capability [66.59139960234326]
大規模言語モデル(LLM)は汎用的な問題解決手段として広くデプロイされている。
本稿では,クエリ上でモデルが期待する精度を目標とするキャリブレーションを提案する。
我々の結果は、キャパシティ校正された信頼度がpass@$k$予測と推論予算割り当てを改善することを示している。
論文 参考訳(メタデータ) (2026-02-14T01:07:45Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Uncertainty-aware Language Modeling for Selective Question Answering [107.47864420630923]
本稿では,不確実性を考慮したLLMを生成するLLM変換手法を提案する。
我々のアプローチはモデルとデータに依存しず、計算効率が高く、外部モデルやシステムに依存しない。
論文 参考訳(メタデータ) (2023-11-26T22:47:54Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。