論文の概要: Beyond Answer Confidence: A Controlled Audit of Self-Knowledge in a Black-Box Decision Model
- arxiv url: http://arxiv.org/abs/2610.01006v1
- Date: Thu, 01 Oct 2026 03:53:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.884907
- Title: Beyond Answer Confidence: A Controlled Audit of Self-Knowledge in a Black-Box Decision Model
- Title(参考訳): 回答信頼を超えて:ブラックボックス決定モデルにおける自己知識の制御された監査
- Abstract要約: Jevは15以上の公開データセットと6つの生成されたタスクファミリを備えた意思決定モデルであり、固定アイテムに供給される情報を変更するペアによる介入を備えている。
我々は15以上の公開データセットと6つの生成されたタスクファミリを持つ決定モデルであるJevにおいて、この区別を監査する。
解答関連情報がないため、最大0.80を有能なオプションに割り当て、観測された知識境界を超えるニュースでは精度0.21-0.33を超える。
- 参考スコア(独自算出の注目度): 3.1178859467674687
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Decision models return probabilities intended for routing, abstention and automated action. Calibration makes those probabilities useful on average, but does not establish whether low confidence reflects chance or missing knowledge, nor whether confidence falls when a model moves beyond what it knows. We audit this distinction in Jev, a decision model, with over 15 public datasets and 6 generated task families, with paired interventions that vary the information supplied for a fixed item. Jev's confidence is calibrated on familiar closed-choice tasks but fails as an indicator of missing knowledge: with no answer-relevant information it assigns up to 0.80 to a salient option, and on news beyond an observed knowledge boundary it exceeds accuracy by 0.21--0.33, a gap that recalibration on earlier months does not close. Targeted yes/no questions give sharper readouts of the case: whether an outcome is settled (AUROC 1.00) and whether the evidence suffices (0.95, against 0.85 for confidence on the same items). Asking whether Jev knows the answer appears to flag fabricated entities and post-boundary news (0.91), but with realistic names or with dates removed it shows no advantage over answer uncertainty. Black-box knowledge audits therefore need explicit controls for surface cues. Code: https://github.com/Syntheme/beyond-answer-confidence.
- Abstract(参考訳): 決定モデルは、ルーティング、棄権、自動アクションを意図した確率を返す。
キャリブレーションはこれらの確率を平均的に有用にしますが、低い信頼度がチャンスや不足した知識を反映するかどうか、あるいはモデルが知っているものを超えると信頼が落ちるかどうかを定めていません。
我々は15以上の公開データセットと6つの生成されたタスクファミリを持つ決定モデルであるJevにおいて、この区別を監査する。
Jevの自信は、よく知られたクローズドチョイスのタスクに基づいて校正されるが、不足した知識の指標として失敗する: 回答関連情報がないため、解答関連情報は0.80まで有能なオプションに割り当てられ、観測された知識境界を超えるニュースでは精度0.21-0.33を超える。
結論が確定したかどうか(AUROC 1.00)と証拠が一致したかどうか(0.95、同一項目に対する信頼が0.85)である。
Jevは、この答えが偽造されたエンティティやポストバウンダリニュース(0.91)にフラグを付けるように見えるかどうかを尋ねるが、現実的な名前や日付が取り除かれたことで、答えの不確実性に対する優位性は示されていない。
そのため、ブラックボックスの知識監査はサーフェスキューの明示的な制御を必要とする。
コード:https://github.com/Syntheme/beyond-answer-confidence.com
関連論文リスト
- Evaluating Persistent Calibration under Evolving Model Knowledge [62.14945418630062]
我々は、信頼度が知識に依存しているかどうかを、信頼度推定の信頼性に影響を及ぼす問題に光を当てることを目指している。
予測時間と微調整法の両方が,将来のチェックポイントで訓練されたオラクル法と比較して,コントラストセットの校正で不足していることを示す。
あるチェックポイント上で適切に校正される可能性のある信頼関数の広大な空間が存在するため、永続的な校正が難しいという仮説の証拠を提供する。
論文 参考訳(メタデータ) (2026-09-30T02:29:31Z) - Beyond Verbalized Confidence: Calibrating Reasoners with Differentiable Readouts [57.65087348754571]
検証可能な報酬(RLVR)による強化学習は、モデルに正しい回答を与えるよう推論するモデルを訓練するが、その信頼性が校正されることは保証しない。
近年の手法では、RLVRループ内のキャリブレーションを、モデルが応答に付随して数値的信頼度を持たせることで訓練しているが、これらはすべてテキストとしてサンプリングすることで信頼性を得る。
我々は、サンプリングを決定論的読み出しに置き換えるためにCREDO(Confidence REaDOut)を提案する。
論文 参考訳(メタデータ) (2026-09-28T10:47:41Z) - A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal [0.11280931253550518]
内部認識のプローブ (Probe of Internal Recognition, PIR) は、有罪な知識を識別する法医学的手法である。
モデルの内部状態から、モデルが正しいと認識する候補に質問を提示し、読み出す。
PIRは、認識された回答を0.70から0.87のバランスの取れた精度で回復し、0.28から0.40の未知の基準線と0.25の確率速度よりもはるかに高い。
論文 参考訳(メタデータ) (2026-09-18T16:57:00Z) - Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation [8.970269049715933]
最近の研究は、複雑なモデルが自身の内部を監査し、何を変えたかを呼び出して、自信を持って報告できることを示している。
われわれはこの主張を7家族の8つのオープンウェイトモデルで検証し、そのような能力は見つからなかった。
テストのためにOpen-Weight Masked Introspection (OWMI)というフレームワークを開発しました。
論文 参考訳(メタデータ) (2026-08-20T21:09:50Z) - Do Models Know Why They Changed Their Mind? Interpretability and Faithfulness of Chain-of-Thought Under Knowledge Conflict [0.0]
言語モデルがその訓練知識と矛盾する文書を見た場合、その文書に従うか、自分自身を信頼するかを選択する必要がある。
CoTの推論は、反対の判断に対して非常に安定しています。
しかし、自己評価の自信はかすかなシグナルを持っている。
論文 参考訳(メタデータ) (2026-05-26T23:46:04Z) - Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty [19.65441892575154]
UA-Benchは、知識集約型タスクと推論集約型タスクにまたがる6つのデータセットから抽出された3500以上の質問のベンチマークである。
18のフロンティアLCMの評価は、最先端のモデルでさえ、データの不確実性とモデルの不確実性を確実に識別するのに苦労していることを示している。
思考モードにおけるQwen3-4B-Instruct-2507とQwen3-8Bの両方の実験結果から,提案手法は解答精度を保ちながら不確実性が向上することが示された。
論文 参考訳(メタデータ) (2026-04-19T07:15:23Z) - Probabilistic Modeling of Disparity Uncertainty for Robust and Efficient Stereo Matching [61.73532883992135]
本稿では,新しい不確実性を考慮したステレオマッチングフレームワークを提案する。
我々はベイズリスクを不確実性の測定として採用し、データを別々に見積もり、不確実性をモデル化する。
論文 参考訳(メタデータ) (2024-12-24T23:28:20Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z) - Dense Uncertainty Estimation via an Ensemble-based Conditional Latent
Variable Model [68.34559610536614]
我々は、アレータリック不確実性はデータの固有の特性であり、偏見のないオラクルモデルでのみ正確に推定できると論じる。
そこで本研究では,軌道不確実性推定のためのオラクルモデルを近似するために,列車時の新しいサンプリングと選択戦略を提案する。
以上の結果から,提案手法は精度の高い決定論的結果と確実な不確実性推定の両方を達成できることが示唆された。
論文 参考訳(メタデータ) (2021-11-22T08:54:10Z) - How Can We Know When Language Models Know? On the Calibration of
Language Models for Question Answering [80.82194311274694]
言語モデルがいつ、自信を持って、特定のクエリに対する答えを知っているか、どのように知ることができるか?
我々は,T5,BART,GPT-2の3つの強力な生成モデルを検討した。
次に、そのようなモデルの校正方法を検討し、その信頼性スコアを正しさの確率と相関させる。
論文 参考訳(メタデータ) (2020-12-02T03:53:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。