論文の概要: When Should a Language Model Trust Itself? Same-Model Self-Verification as a Conditional Confidence Signal
- arxiv url: http://arxiv.org/abs/2605.02915v1
- Date: Wed, 08 Apr 2026 20:15:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 06:56:26.517575
- Title: When Should a Language Model Trust Itself? Same-Model Self-Verification as a Conditional Confidence Signal
- Title(参考訳): 言語モデルはいつ信頼すべきなのか?条件付き信頼信号としての自己検証と同じ
- Authors: Aditya Ajay Phalod,
- Abstract要約: モデルに予測された回答を監査するよう促す自己検証は、選択的な予測のための確実な信頼信号であるが、その実用的価値は未だ不明である。
ARC-Challenge と TruthfulQA-MC の2つのベースラインである LL-AVG と LL-SUM に対する自己検証を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Same-model self-verification, prompting a model to audit its own predicted answer, is a plausible confidence signal for selective prediction, but its practical value remains unclear once strong likelihood-based baselines are taken seriously. We evaluate self-verification against two such baselines, LL-AVG and LL-SUM, on ARC-Challenge and TruthfulQA-MC across multiple model families, scales, and prompt variants. We measure not only correctness ranking, but also abstention quality through AURC and operating-point analyses. The results are sharply task- and model-dependent. On ARC-Challenge, self-verification substantially improves over LL-AVG for Phi-2 and the Qwen models, with the largest gains appearing in Qwen-7B. On TruthfulQA-MC, however, the signal is less reliable: smaller models can become prompt-sensitive, DeepSeek-R1-Distill-8B degrades relative to LL-AVG, and LL-SUM often remains the stronger practical baseline. We therefore do not treat self-verification as a general-purpose uncertainty estimator. In this setting, it is better understood as a conditional confidence signal whose value depends on task type, model family, prompt formulation, and, crucially, the baseline it must beat.
- Abstract(参考訳): 同じモデルによる自己検証は、モデルが予測された回答を監査することを促し、選択的な予測のための確実な信頼信号であるが、強い可能性ベースのベースラインが真剣に取られると、その実用的価値は明らかでない。
我々は,ARC-Challenge と TruthfulQA-MC の2つのベースラインである LL-AVG と LL-SUM に対する自己検証を,複数のモデルファミリ,スケール,即時変種に対して評価した。
AURCとオペレーティングポイント分析により,正当性ランキングだけでなく,禁忌品質も測定した。
結果はタスクに依存し、モデルに依存します。
ARC-Challengeでは、Phi-2とQwenモデルのLL-AVGよりも自己検証が大幅に改善され、Qwen-7Bで最大のゲインが現れる。
しかし、TrathfulQA-MCでは、信号は信頼性が低く、より小型のモデルではプロンプトに敏感になり、DeepSeek-R1-Distill-8BはLL-AVGと比較して劣化し、LL-SUMはより強力な実用ベースラインのままである。
したがって、自己検証を汎用的不確実性推定器として扱わない。
この設定では、タスクタイプ、モデルファミリー、迅速な定式化、そして重要な点として、それが負うべきベースラインに依存する条件信頼信号として理解される。
関連論文リスト
- FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence [22.382291859991472]
本稿では,大言語モデルが抑止力を考慮した意思決定を支援するかを評価するための決定論的指標である行動アライメントスコア(BAS)を紹介する。
BASは、明示的な回答または持続可能なユーティリティモデルから派生し、リスク閾値の連続体にわたって実現されたユーティリティを集約する。
理論的には、真理信頼度推定は期待されるBASユーティリティを一意に最大化し、キャリブレーションと決定-最適行動のリンクを示す。
論文 参考訳(メタデータ) (2026-04-03T17:44:32Z) - Cross-Model Disagreement as a Label-Free Correctness Signal [10.66607150500579]
クロスモデル不一致は、既存の生産システムにドロップできる正確性指標である。
検証モデルからの生成は不要であり、正当性ラベルは不要である。
その結果、ラベルなしの正当性推定に対する実践的で訓練のないアプローチとして、クロスモデル不一致が確立された。
論文 参考訳(メタデータ) (2026-03-26T13:46:22Z) - On Calibration of Large Language Models: From Response To Capability [66.59139960234326]
大規模言語モデル(LLM)は汎用的な問題解決手段として広くデプロイされている。
本稿では,クエリ上でモデルが期待する精度を目標とするキャリブレーションを提案する。
我々の結果は、キャパシティ校正された信頼度がpass@$k$予測と推論予算割り当てを改善することを示している。
論文 参考訳(メタデータ) (2026-02-14T01:07:45Z) - Fact-Checking with Large Language Models via Probabilistic Certainty and Consistency [7.806516365113592]
大規模言語モデル(LLM)は、事実の正確性を必要とするアプリケーションでますます使われている。
事実チェックはこれらのエラーを軽減することができるが、既存の手法は通常、外的証拠を無差別に回収する。
本稿では,確率的確実性と一貫性(PCC)について紹介する。
論文 参考訳(メタデータ) (2026-01-05T21:57:41Z) - Evaluating Large Language Models for Phishing Detection, Self-Consistency, Faithfulness, and Explainability [0.0]
大規模言語モデル(LLM)は、ドメイン固有のフィッシング分類タスクを改善するための有望な方向性と可能性を示している。
LLMはフィッシングメールを正確に分類するだけでなく、予測に確実に適合し、内部に一貫性のある説明を生成することができるのか?
BERT、Llamaモデル、Wizardなど、微調整されたトランスフォーマーベースのモデルを使って、ドメインの関連性を改善し、特定の区別をフィッシングするように調整しています。
論文 参考訳(メタデータ) (2025-06-16T17:54:28Z) - Verbalized Confidence Triggers Self-Verification: Emergent Behavior Without Explicit Reasoning Supervision [12.287123198288079]
大規模言語モデル(LLM)の安全な配置には不確実性校正が不可欠である
我々は,スカラー信頼ラベルのみを用いた教師付き微調整が,言語モデルの自己検証行動を引き出すのに十分であることがわかった。
キャリブレーションされた不確実性に基づいて,テスト時間スケーリングによる性能向上を図った簡易な再考手法を提案する。
論文 参考訳(メタデータ) (2025-06-04T08:56:24Z) - Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards [67.86091419220816]
大規模言語モデル(LLM)は複雑な推論において非常に有望である。
一般的な問題は表面的な自己回帰であり、モデルが自身の出力をしっかりと検証できない。
本稿では、RISE(Reinforce Reasoning with Self-Verification)という新しいオンラインRLフレームワークについて紹介する。
論文 参考訳(メタデータ) (2025-05-19T17:59:31Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。