論文の概要: Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility
- arxiv url: http://arxiv.org/abs/2608.10315v1
- Date: Mon, 10 Aug 2026 23:38:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.848698
- Title: Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility
- Title(参考訳): これがあなたの最終回答か? LLMの信頼性測定としてのコンテキスト横断一貫性
- Authors: Siyang Wu, Yibo Jiang, Bryon Aragam,
- Abstract要約: 我々は、オリジナルのプロンプトと摂動的プロンプトのモデル生成を比較して、コンテキスト間一貫性(C3)を運用する。
より小さなコンテキスト間シフトによる回答は、正しいか、現実的である可能性が高いことが分かりました。
- 参考スコア(独自算出の注目度): 27.380276941982416
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are powerful black-box systems, making it difficult to discern whether their answers reflect stable internal beliefs or superficial pattern matching. We identify cross-contextual consistency as an underutilized behavioral property of LLMs: a credible answer should remain stable when the same task is placed under topic-aligned, content-neutral contextual variation. Building on this intuition, we operationalize Cross-Contextual Consistency (C3) by comparing model generations under original and perturbed prompts. Across 26 models and six benchmarks spanning reasoning, factuality, and code generation, we find that answers with smaller cross-contextual shifts are more likely to be correct or factual. We demonstrate that C3 provides a complementary axis of evaluation and can serve as a benchmark usefulness diagnostic, identifying which portions of a benchmark remain informative even when aggregated scores are widely considered "saturate".
- Abstract(参考訳): 大規模言語モデル(LLM)は強力なブラックボックスシステムであり、その答えが安定した内的信念や表面的パターンマッチングを反映しているかを識別することは困難である。
我々は,LLMの非活用行動特性としてコンテキスト間の整合性を同定し,同じタスクをトピックアライメントされたコンテンツニュートラルなコンテキスト変動下に置く場合,信頼性の高い回答は安定していなければならない。
この直感に基づいて、モデル生成をオリジナルのプロンプトと摂動的なプロンプトで比較することにより、クロスコンテキスト一貫性(C3)を運用する。
推論、事実性、コード生成にまたがる26のモデルと6つのベンチマークでは、より小さなコンテキスト間シフトによる回答が正しいか、現実的である可能性が高いことが分かりました。
我々はC3が相補的な評価軸を提供し、ベンチマークの有用性診断として機能し、集約されたスコアが広く「飽和」であるとしても、ベンチマークのどの部分が情報的であり続けるかを特定することを実証した。
関連論文リスト
- LLMs Show No Signs Of Individuated Metacognition [0.023227405857540805]
20大言語モデルから二項信頼判断を分解する。
信頼性が異なる2つのモデルも性能が異なるかどうかを問う。
いずれの検査領域においても,有意な弁別メタ認知の証拠は見つからない。
論文 参考訳(メタデータ) (2026-05-22T23:54:33Z) - Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy [41.17236645999555]
本研究では,現実的な質問応答や数学的推論タスクにおいて,意味保存的言い回しの下でモデル解がどう変化するかを検討する。
4つのベンチマークと13のモデルで、モデル出力はプロンプトの正確な表現に依存することが多い。
多くの質問に対して、モデルはフレーズによって正しい答えと間違った答えを交互に行い、ミスマッチ率は23%以上に達する。
論文 参考訳(メタデータ) (2026-05-18T16:45:13Z) - Evian: Towards Explainable Visual Instruction-tuning Data Auditing [14.93566912726999]
本稿では,モデル応答を構成的認知要素に分解する「分解的評価」パラダイムを提案する。
このパラダイムを、画像テキスト一貫性、論理コヒーレンス、ファクチュアル正確性の軸に沿ってこれらのコンポーネントを評価する自動化フレームワークであるEVIANを介してインスタンス化する。
論文 参考訳(メタデータ) (2026-04-22T13:28:27Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities? [61.533560295383786]
Unified Multimodal Large Language Models (U-MLLM) は、単一のアーキテクチャ内で理解と生成を統合する。
我々は,U-MLLMが画像のモダリティにおいて同じ結果をレンダリングするために必要な場合,意味的等価性を維持することができないことを観察する。
VGUBenchは、推論ロジックを生成の忠実性から切り離すためのフレームワークである。
論文 参考訳(メタデータ) (2026-02-27T06:23:56Z) - Certainty robustness: Evaluating LLM stability under self-challenging prompts [0.5156484100374058]
大規模言語モデル(LLM)は、確実性や真実を推論する明確なメカニズムが欠如しているにもかかわらず、高い自信を持って答えを提示することが多い。
本稿では,LLMの安定性と適応性のバランス性を評価するための2ターン評価フレームワークであるCertainty Robustness Benchmarkを紹介する。
我々はLiveBenchの200の推論と数学の質問を用いて、4つの最先端LCMを評価し、正当性のある自己補正と正当性のない答えの変化を区別する。
論文 参考訳(メタデータ) (2026-02-10T18:07:51Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency [78.91846841708586]
完全な自己整合性で答えられた事実でさえ、軽微な文脈干渉の下で急速に崩壊することを示します。
本研究では,概念的近傍における応答コヒーレンスを評価する信念の構造尺度であるNighbor-Consistency Belief(NCB)を提案する。
また、文脈不変の信念構造を最適化し、長い知識の脆さを約30%低減する構造意識訓練(SAT)を提案する。
論文 参考訳(メタデータ) (2026-01-09T16:23:21Z) - A Controllable Examination for Long-Context Language Models [62.845852724511964]
本研究では,長文言語モデルを評価するベンチマークである$textbfLongBioBenchを紹介する。
その結果,ほとんどのモデルでは,検索結果に対する意味的理解や基礎的推論が不足していることが判明した。
我々のさらなる分析は、文脈的非コヒーレンスなど、既存の合成ベンチマークで採用されているいくつかの設計選択を示している。
論文 参考訳(メタデータ) (2025-06-03T14:23:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。