論文の概要: Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework
- arxiv url: http://arxiv.org/abs/2607.08017v1
- Date: Thu, 09 Jul 2026 00:45:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.379038
- Title: Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework
- Title(参考訳): LLMの論理は信頼できるか?グラフベースのフレームワークによる不確かさ、一貫性、ロバストさの定量化
- Abstract要約: GraphEVAL はグラフベースの推論フレームワークであり、不確実性定量化(UQ)を全体論的推論忠実性問題として再編成する。
推論空間の意味的構造的コンセンサスを定量化する新しいUQ測度であるグラフ推論コヒーレンススコア(GRCS)を提案する。
また,グラフ自己整合性 (GSC) も導入した。
- 参考スコア(独自算出の注目度): 0.6743011393792991
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large-Language Models (LLMs) can be prone to flawed and unfaithful reasoning that decoding strategies like Self-Consistency (SC) fail to detect as they evaluate only final-answer agreement while ignoring the logical validity of intermediate steps. This raises three fundamental questions: How can we reliably quantify uncertainty in LLM reasoning? Can semantic, structural, and causal awareness select more faithful reasoning compared to naïve majority voting? and How robust is reasoning topology under adversarial conditions? To address these questions, we introduce GRAPHEVAL, a graph-based reasoning framework that re-frames uncertainty quantification (UQ) as a holistic reasoning fidelity problem. We propose a novel UQ metric, Graph Reasoning Coherence Score (GRCS), that quantifies semantic-structural consensus of the reasoning space and captures pathological mode collapse and confident hallucinations. We find that GRCS is the only metric that is consistently negatively correlated with reasoning faithfulness across both more capable and smaller models. Additionally, we introduce Graph Self-Consistency (GSC), a medoid-based decoding strategy that trades nominal accuracy for reasoning fidelity, exposing the degree to which SC is inflated by unfaithful lucky guesses in smaller models, while preserving or improving accuracy in more capable ones. Finally, through adversarial medoid ablation, we demonstrate that the GSC-selected path acts as a "load-bearing path" and forcing models away from it degrades reasoning faithfulness and, in targeted cases, causes drops in accuracy.
- Abstract(参考訳): LLM(Large-Language Models)は、自己整合性(SC)のようなデコード戦略が、中間ステップの論理的妥当性を無視しながら、最終回答合意のみを評価するため、検出できないという欠陥があり、不誠実な理由になる。
LLM推論における不確実性を確実に定量化するにはどうすればいいのか?
意味的、構造的、因果的な認識は、ナイーブ多数決よりも忠実な推論を選ぶことができるか?
逆境条件下でのトポロジの推論はどの程度堅牢か?
これらの問題に対処するために,不確実性定量化(UQ)を再編成するグラフベースの推論フレームワークである GraphEVAL を,総合的推論忠実度問題として紹介する。
本稿では,新たなUQ尺度であるGRCS(Graph Reasoning Coherence Score)を提案する。
GRCSは、より有能なモデルとより小さなモデルの両方において、推論忠実度と一貫して負の相関を持つ唯一の計量である。
さらに,グラフ自己整合性(GSC)というメドイドベースのデコード戦略を導入し,より有能なモデルでは精度を保ちながら,SCが不誠実なラッキーな推測によって膨らませられる程度を露呈する。
最後に, 逆行性メドイドアブレーションにより, GSC選択経路が「積載経路」として機能し, モデルから遠ざけることにより, 忠実度を低下させ, ターゲットとした場合, 精度が低下することを示した。
関連論文リスト
- Beyond Semantic Equivalence: Logical Graphs for LLM Uncertainty Quantification [30.900501335481184]
我々は,回答間の含意と非互換性を明示的にモデル化するフレームワークである,論理グラフ不確実性(LGU)を提案する。
複数の質問応答ベンチマークにおいて、LGUは既存の手法に対する不確実性評価を一貫して改善している。
論文 参考訳(メタデータ) (2026-07-18T16:14:08Z) - LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition [55.572260012037084]
本稿では, LC-ERD (Logic-Consistent Endogenous Reward Decomposition) を紹介する。
モデルの潜在論理エキスパートズ(Latent Logic Expertise)からのコンセンサスを集約することで、変分論理ポテンシャルを導出する。
LC-ERDは、論理の一貫性と正確性の間のトレードオフを明らかにする、堅牢な自己進化パスを提供する。
論文 参考訳(メタデータ) (2026-05-19T07:27:50Z) - Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis [29.865115662967252]
LLM推論トレースは複雑な欠陥に悩まされている -- * 内部的欠陥* (論理的誤り、幻覚など) と * 側的欠陥* (再考、再考)
論文 参考訳(メタデータ) (2026-04-15T17:43:10Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models [1.5001933823689926]
推論は、ほとんどの不確実性推定の品質を一貫して低下させることを示す。
暗黙の回答条件付けを主要なメカニズムとみなす。
対照的に、合意に基づく一貫性は堅牢であり、しばしば推論の下で改善される。
論文 参考訳(メタデータ) (2026-03-17T16:12:06Z) - CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching [50.65932158912512]
そこで我々は,新しい大言語モデルの開発を促進するために,因果推論ベンチマークCausalFlipを提案する。
CaulFlipは、イベントトリプル上に構築された因果判断の質問で構成されており、共同創設者、チェーン、コライダーの関係が異なっている。
回答のみのトレーニング,明示的なチェーン・オブ・ソート監視,そして内在型因果推論アプローチなどを含む,複数の訓練パラダイムによるLCMの評価を行った。
論文 参考訳(メタデータ) (2026-02-23T18:06:15Z) - RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models [5.733004743054914]
大規模な推論モデル(LRM)は、強い性能を示すが、しばしば妥当に聞こえるが、真の決定過程を反映しない合理性を生み出す。
2つのテスト可能な条件で定義された忠実性を推論するための公式な枠組みを導入する。
RFEvalは、7,186インスタンスのベンチマークであり、制御された出力レベルの対実的介入を通じて忠実さを調査する。
論文 参考訳(メタデータ) (2026-02-19T03:49:37Z) - Certainty-Guided Reasoning in Large Language Models: A Dynamic Thinking Budget Approach [0.15749416770494704]
CGR(Certainty-Guided Reasoning)はトークン使用量を削減するとともに,ベースライン精度を向上させる。
CGRは、確実なしきい値と効率の間の調整可能なトレードオフによって、数百万のトークンを集約的に排除することができる。
信頼性を推論プロセスに統合することにより、CGRは大きな推論言語モデルをより適応的で信頼性があり、リソース効率が良いものにする。
論文 参考訳(メタデータ) (2025-09-09T14:57:15Z) - Mitigating Misleading Chain-of-Thought Reasoning with Selective Filtering [59.495717939664246]
大規模言語モデルは、複雑な問題を解くためにチェーン・オブ・ソート(CoT)推論技術を活用することで、顕著な能力を示した。
本稿では,選択フィルタリング推論(SelF-Reasoner)と呼ばれる新しい手法を提案する。
SelF-ReasonerはScienceQA、ECQA、LastLetterタスクに対して、微調整されたT5ベースラインを一貫して改善する。
論文 参考訳(メタデータ) (2024-03-28T06:28:35Z) - Language Models with Rationality [57.37201135072838]
大規模言語モデル(LLM)は質問応答(QA)に熟練している
答えが潜んでいる「信条」からどのように従うか(あるいはたとえも)は必ずしも明確ではない。
論文 参考訳(メタデータ) (2023-05-23T17:04:25Z) - A Weaker Faithfulness Assumption based on Triple Interactions [89.59955143854556]
より弱い仮定として, 2$-adjacency faithfulness を提案します。
より弱い仮定の下で適用可能な因果発見のための音方向規則を提案する。
論文 参考訳(メタデータ) (2020-10-27T13:04:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。