論文の概要: From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers
- arxiv url: http://arxiv.org/abs/2608.23660v1
- Date: Mon, 24 Aug 2026 15:55:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.469585
- Title: From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers
- Title(参考訳): 因果的可塑性から因果的信頼性へ:LCMを校正直接因果的分類器として評価する
- Authors: Amit Kumar, Elnur Adl Zarabi, Suranjana Trivedy, Zhiqian Chen, Lei Zhang, Kaiqun Fu, Taoran Ji,
- Abstract要約: 大規模言語モデル(LLM)は、構造因果発見のための事前因果的知識を提供するために、ますます使われてきている。
我々は,6つのベンチマーク因果グラフ,5つのプロンプト戦略,4つの信頼源にまたがる12の命令調整されたオープンウェイトモデルを評価する。
以上の結果から,LSMは軟因果関係の直接的証拠であるよりも,外部から検証された軟因果関係の源であると考えられることが示唆された。
- 参考スコア(独自算出の注目度): 15.44881677475537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used to provide prior causal knowledge for structural causal discovery, yet whether their direct-edge judgments and confidence can be trusted remains unclear. We systematically evaluate 12 instruction-tuned open-weight models across six benchmark causal graphs, five prompting strategies, and four confidence sources: verbalized, logit-based, cross-prompt agreement, and cross-model agreement. Under our language-only pairwise protocol, our evaluation yields three key findings. (i) LLM-based causal judgments are strongly recall-dominant: models predict overly dense graphs with many false-positive edges, while prompting mainly shifts the precision-recall trade-off rather than resolving overprediction. Gains from model scale diminish on the largest graphs and do not eliminate miscalibration. (ii) LLMs often capture causal relatedness without reliably identifying directness or orientation. Relative to published reference graphs, models misclassify 40.0% of indirect and 36.0% of reversed non-edges as direct edges, versus 28.2% of other non-edges. Moreover, 80.8% and 84.6% of these false positives receive verbalized confidence of at least 80%, revealing substantial overconfidence in structurally incorrect predictions. (iii) Conventional confidence estimates are unreliable, whereas agreement offers a more promising signal. Logit-based confidence frequently collapses near 1.0 regardless of correctness, while cross-prompt and cross-model agreement achieve better mean calibration and discrimination, though their advantages are not statistically significant after Holm correction. A benchmark-familiarity audit further identifies potential familiarity in five model-dataset pairs, all involving AsiaM. Overall, our results suggest LLMs are better viewed as sources of externally validated soft causal priors than as direct evidence of causal structure.
- Abstract(参考訳): 大規模言語モデル(LLM)は、構造因果的発見に先立って因果的知識を提供するためにますます使われてきているが、その直接的な判断と信頼性が信頼できるかどうかは不明のままである。
我々は,6つのベンチマーク因果グラフ,5つのプロンプト戦略,および4つの信頼源(言語化,ロジットベース,クロスプロンプト契約,クロスモデル合意)にまたがる12の命令調整オープンウェイトモデルを体系的に評価した。
言語のみのペアワイズプロトコルでは,3つの重要な結果が得られた。
(i) LLMに基づく因果判断は、強いリコール優位である:モデルは、多くの偽陽性エッジを持つ過度に密度の高いグラフを予測し、一方、主に過剰予測を解決するのではなく、精度-リコールトレードオフをシフトさせる。
モデルスケールからのゲインは最大のグラフで減少し、誤校正を排除しない。
(ii)LSMは、直接性や向きを確実に特定することなく因果関係を捉えることが多い。
公表された参照グラフとは対照的に、モデルは間接の40.0%、逆の36.0%を直接のエッジとして、他の非エッジの28.2%と誤って分類している。
さらに、これらの偽陽性者の80.8%と84.6%は、少なくとも80%の言語化された信頼を受けており、構造的に誤った予測においてかなりの過度な自信を示している。
三 従来の信任性評価は信頼できないが、協定はより有望な信号を提供する。
ログベースの信頼度は、正確性に関わらず1.0近くで頻繁に崩壊するが、クロスプロンプトとクロスモデル合意は、ホルム補正後の統計的に有意ではないが、平均校正と差別をより良く達成する。
ベンチマーク・ファミリティ監査では、AsiaMを含む5つのモデル・データセットの親しみやすさをさらに確認している。
以上の結果から,LSMは軟因果関係の直接的証拠であるよりも,外部から検証された軟因果関係の源であると考えられることが示唆された。
関連論文リスト
- LLM Doesn't Know What It Doesn't Know: Detecting Epistemic Blind Spots via Cross-Model Attribution Divergence on Clinical Tabular Data [2.1443570696048906]
大規模言語モデル(LLM)は、構造化された臨床データにますます適用される。
Qwen 2.5 7B と XGBoost を比較する。
論文 参考訳(メタデータ) (2026-06-17T18:49:44Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection [0.0]
大規模言語モデル(LLM)は、ますます重要な意思決定システムにデプロイされている。
出力アンカートークン確率に基づく正規化信頼スコアを導入する。
これにより、最小限のオーバーヘッドでエラーや幻覚を直接検出できる。
論文 参考訳(メタデータ) (2026-02-18T07:05:12Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Can Large Language Models Express Uncertainty Like Human? [71.27418419522884]
我々は,人間に注釈を付けた信頼スコアを持つヘッジ式の最初の多種多様な大規模データセットをリリースする。
現代大言語モデルにまたがる言語信頼に関する最初の体系的研究を行う。
論文 参考訳(メタデータ) (2025-09-29T02:34:30Z) - Confidence-Aware Routing for Large Language Model Reliability Enhancement: A Multi-Signal Approach to Pre-Generation Hallucination Mitigation [0.0]
大規模言語モデルは幻覚に悩まされ、可視だが事実的に誤った内容を生成する。
現在の緩和戦略は、計算コストが高く、信頼性の低いコンテンツ生成を防げない、ポストジェネレーション補正に重点を置いている。
本稿では,予測された信頼性に基づいて,モデルの不確実性を積極的に評価し,クエリをリダイレクトする信頼度対応ルーティングシステムを提案する。
論文 参考訳(メタデータ) (2025-09-23T18:34:20Z) - MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs [66.14178164421794]
メタファイト(MetaFaith)は、ヒトのメタ認知に触発された新規なプロンプトベースのキャリブレーション手法である。
MetaFaithは多種多様なモデルやタスク領域における忠実なキャリブレーションを強力に改善し、忠実度を最大61%向上させることができることを示す。
論文 参考訳(メタデータ) (2025-05-30T17:54:08Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Mind the Confidence Gap: Overconfidence, Calibration, and Distractor Effects in Large Language Models [0.6091702876917281]
大規模言語モデル(LLM)は、自然言語処理において顕著な熟練度を示す。
予測された信頼と真の正しさの過度なミスサライメントは、重要な意思決定アプリケーションに重大なリスクをもたらす。
9つのLCMと3つの質問応答データセットにわたるLCMの校正に関する包括的分析を行った。
論文 参考訳(メタデータ) (2025-02-16T07:46:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。