論文の概要: Two Axes of LLM Abstention: Answer Correctness and Question Answerability
- arxiv url: http://arxiv.org/abs/2607.08456v1
- Date: Thu, 09 Jul 2026 13:17:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.5479
- Title: Two Axes of LLM Abstention: Answer Correctness and Question Answerability
- Title(参考訳): LLM吸収の2つの軸:答えの正しさと質問応答性
- Abstract要約: モデルは2つの異なることを拒否すべきである。
3つのファミリーの5つの命令調整モデルにまたがって、それらは別々の軸である。
回答可能性スコアと正当性スコアがそれぞれ別々に認定された場合にのみ答える、校正されたポリシーに変換する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A model should refuse two different things: answers it would get wrong, and questions it should not answer at all, such as unanswerable ones or ones resting on a false premise. The usual recipe thresholds a single confidence score, which cannot tell these apart. Across five instruction-tuned models from three families (2B to 14B), we find they are separate axes. Ordinary answer-confidence tracks whether an answer is right but is nearly blind to whether the question is answerable; a linear probe on hidden states does the reverse. The blind spot does not shrink with scale. It is worst on naturally occurring false-premise questions (CREPE). There, answer-confidence, P(IK), P(True), and even asking the model outright whether a premise is false all stay near chance, while a hidden-state probe reaches 0.69 to 0.77 AUROC: the model represents a problem it will not report. This turns out to be fixable. Instructing a model to check premises backfires, because it then disputes sound and false premises alike (57% false challenges), unable to tell them apart; routing the same instruction with the probe roughly triples challenge precision. We turn the two axes into a calibrated policy that answers only when an answerability score and a correctness score each clear a separately certifies behave differently: the unanswerable-answer rate is controllable at every scale, while the wrong-answer rate is capped by model accuracy, so the guarantee tightens as threshold policy certifies both budgets at 0.75 coverage of correct answers, against 0.31 for a single threshold; at 14B it is the only policy that certifies at all.
- Abstract(参考訳): モデルは2つの異なることを拒否すべきである。答えは間違っているだろうし、答えは答えるべきではない。
通常のレシピは、これらを区別できない単一の信頼スコアを閾値とする。
3つのファミリー(2Bから14B)の5つの命令調整モデルにまたがって、それらは別々の軸である。
通常の回答信頼度は、解答が正しいかどうかを追跡するが、解答可能かどうかはほとんど盲目である。
ブラインドスポットはスケールで縮小しません。
自然発生の疑似前提質問(CREPE)では最悪である。
答えの自信、P(IK)、P(True)、そして前提がすべて偽であるかをモデルに問うことさえあり、一方隠れ状態のプローブは0.69から0.77AUROCに達する。
これは修正可能であることが判明した。
構内バックファイアをチェックするためのモデルを指示するのは、音と偽の構内を争うため(57%の誤った挑戦)、それらを区別できないためである。
解答可能性スコアと正当性スコアがそれぞれ別々に認定された場合にのみ答える正当性ポリシーを2つにまとめる: 解答確率は各スケールで制御可能であり、誤答率はモデル精度で抑えられ、しきい値ポリシーが正解率0.75で、正解率0.31で保証され、14Bでは認定される唯一のポリシーである。
関連論文リスト
- Legible Failures: Detecting and Repairing In-Context Binding Errors [0.0]
間違った答えは、モデルが必要な情報を欠いているか、保持していたかを示していない。
16の公的なチェックポイントで、それぞれが3つのシードで評価される頻度を測定します。
インコンテキストバインディングは、プローブが動作可能な設定であることに気付きました。
論文 参考訳(メタデータ) (2026-09-10T08:20:15Z) - FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect [69.8983512616053]
大規模な言語モデルは、しばしばユーザによる暗黙のスタンスと一致する微妙な言い換えに応答を変更する。
これによってユーザーは、根拠となる事実ではなく、どのようにして質問を言い表したかというアドバイスをユーザーに残すことができる。
FramingQAは、法律、医学、ファイナンス、ロボットシミュレーションにまたがるフレーミングに疑問を呈するモデル感度を測定するベンチマークである。
論文 参考訳(メタデータ) (2026-09-07T12:56:44Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong [1.2744523252873352]
ブラックボックス(行動)によるFaithCoT-Benchの人間のアノテーションに対する不誠実なCoTの検出。
答えの正しさはあらゆるレベルで問題を構成する。
論文 参考訳(メタデータ) (2026-07-26T04:43:53Z) - Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States [0.0]
厳密で不確実な回答は精査を招待する一方、自信のあるエラーは警告なしで下流の判断を静かに低下させる。
モデルの内部アクティベーションから、どれほど確実にそのような自信ある答え、あるいは自信ある幻覚が検出できるかを問う。
残差ストリーム上で線形プローブを訓練し、2つの確立された質問応答ベンチマークで評価する。
論文 参考訳(メタデータ) (2026-07-13T11:22:25Z) - More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges [4.167333498582309]
言語モデルをそれ自身の参照なし判断に対して訓練することは、モデルが答えの正しさを判断することを前提にしている。
候補者に条件付きで、裁判官は正当性ではなく妥当性をスコアし、政策が悪用することを学習する偽陽性の盆地を残す。
論文 参考訳(メタデータ) (2026-07-07T06:59:30Z) - When Confidence Takes the Wrong Path: Diagnosing Retrieval-State Lock-In in RAG [0.0]
多くのブラックボックスの不確実性法は、まだサンプル回答間の合意を自信として読んでいる。
問題は、デプロイされたRAGで認識されるが、名前、測定可能なシグネチャ、および有病率境界が欠落している。
故障検索状態のロックインを命名し、3つのオブジェクトを1つの信頼スコアが混在して診断する。
論文 参考訳(メタデータ) (2026-06-22T00:08:00Z) - Rift: A Conflict Signature for Deception in Language Models [0.0]
真実を知りながら横たわるモデルは、ELKが行動評価だけでは扱えない中心的なケースである。
このような偽造が、正直な誤りと区別する内部的な署名を残しているかどうかを問う。
偽りのフォワードパスは、競合シグネチャを持つ。2.1-2.3倍の残留ランクを持つ。
論文 参考訳(メタデータ) (2026-06-15T19:22:02Z) - Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs [9.465306048183798]
本稿では,解答安定性を評価するための制御プロトコルを提案する。
モデルが複数の選択問題に正しく答えた後、不正確な選択肢に対する一貫性のある議論でモデルに挑戦する。
自己貢献は相変わらずフリップ率を上昇させる。
論文 参考訳(メタデータ) (2026-06-14T20:45:30Z) - CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization [50.59956036193097]
検証可能な報酬(RLVR)を用いた強化学習における正しい解を生成するモデル
各トークンは、決定的な推論ステップであれ、文法的なフィラーであれ、同じ報酬信号を受信する。
コントラストエビデンスポリシー最適化(CEPO)を提案する。
CEPOは、全てのトークンに対してよりシャープな質問をする:「正しい答えは、このトークンを好むか?」が、「正しい答えは、正しい答えは、それを好む一方で、間違った答えはそれを好まないか?」。
論文 参考訳(メタデータ) (2026-05-19T06:46:19Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z) - Realistic Conversational Question Answering with Answer Selection based
on Calibrated Confidence and Uncertainty Measurement [54.55643652781891]
対話型質問回答モデル(ConvQA)は,会話中に複数回発生した質問文と過去の質問文のペアを用いて質問に回答することを目的としている。
本稿では,会話履歴における不正確な回答を,ConvQAモデルから推定された信頼度と不確実性に基づいてフィルタリングすることを提案する。
我々は2つの標準ConvQAデータセット上で、回答選択に基づくリアルな会話質問回答モデルの有効性を検証する。
論文 参考訳(メタデータ) (2023-02-10T09:42:07Z) - Teaching Models to Express Their Uncertainty in Words [6.356472059420951]
我々は,GPT-3モデルを用いて,自然言語による解答の不確実性を表現することができることを示す。
モデルが自然言語で自身の答えについて校正された不確実性を表現したのはこれが初めてである。
論文 参考訳(メタデータ) (2022-05-28T05:02:31Z) - How Can We Know When Language Models Know? On the Calibration of
Language Models for Question Answering [80.82194311274694]
言語モデルがいつ、自信を持って、特定のクエリに対する答えを知っているか、どのように知ることができるか?
我々は,T5,BART,GPT-2の3つの強力な生成モデルを検討した。
次に、そのようなモデルの校正方法を検討し、その信頼性スコアを正しさの確率と相関させる。
論文 参考訳(メタデータ) (2020-12-02T03:53:13Z) - Selective Question Answering under Domain Shift [90.021577320085]
モデルがドメイン外の入力に対して過度に信頼されているため、モデルのソフトマックス確率のみに基づくアテンションポリシーは不適切である。
キャリブレータをトレーニングして、QAモデルがアースする入力を識別し、エラーを予測した場合に停止する。
提案手法は,80%の精度を維持しながら56%の質問に回答するが,それに対してモデルの確率を直接使用する場合,80%の精度で48%しか回答しない。
論文 参考訳(メタデータ) (2020-06-16T19:13:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。