論文の概要: CausalGaze: Unveiling Hallucinations via Counterfactual Graph Intervention in Large Language Models
- arxiv url: http://arxiv.org/abs/2604.11087v1
- Date: Mon, 13 Apr 2026 07:09:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.381056
- Title: CausalGaze: Unveiling Hallucinations via Counterfactual Graph Intervention in Large Language Models
- Title(参考訳): CausalGaze: 大規模言語モデルにおけるグラフ干渉による幻覚の発見
- Authors: Linggang Kong, Lei Wu, Yunlong Zhang, Xiaofeng Zhong, Zhen Wang, Yongjie Wang, Yao Pan,
- Abstract要約: 構造因果モデル(SCM)に基づく新しい幻覚検出フレームワークCausalGazeを紹介する。
実験では、CousalGazeの有効性、特に最先端のベースラインと比較して、TrathfulQAデータセット上でのAUROCの5.2%以上の改善が示されている。
- 参考スコア(独自算出の注目度): 20.20916393164348
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite the groundbreaking advancements made by large language models (LLMs), hallucination remains a critical bottleneck for their deployment in high-stakes domains. Existing classification-based methods mainly rely on static and passive signals from internal states, which often captures the noise and spurious correlations, while overlooking the underlying causal mechanisms. To address this limitation, we shift the paradigm from passive observation to active intervention by introducing CausalGaze, a novel hallucination detection framework based on structural causal models (SCMs). CausalGaze models LLMs' internal states as dynamic causal graphs and employs counterfactual interventions to disentangle causal reasoning paths from incidental noise, thereby enhancing model interpretability. Extensive experiments across four datasets and three widely used LLMs demonstrate the effectiveness of CausalGaze, especially achieving over 5.2\% improvement in AUROC on the TruthfulQA dataset compared to state-of-the-art baselines.
- Abstract(参考訳): 大きな言語モデル(LLM)による画期的な進歩にもかかわらず、幻覚は高い領域への展開において重要なボトルネックとなっている。
既存の分類に基づく手法は、主に内部状態からの静的信号と受動的信号に依存しており、基礎となる因果メカニズムを見下ろしながら、しばしばノイズや刺激的な相関を捉えている。
この制限に対処するため、我々は、構造因果モデル(SCM)に基づく新しい幻覚検出フレームワークであるCausalGazeを導入することにより、受動的観察から能動的介入へとパラダイムをシフトする。
CausalGaze は LLM の内部状態を動的因果グラフとしてモデル化し、因果推論経路を付随ノイズから切り離し、モデル解釈可能性を高める。
4つのデータセットと3つのLLMにわたる大規模な実験は、CausalGazeの有効性を実証している。
関連論文リスト
- DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning [48.77865928715759]
拡散大言語モデル (D-LLM) は自己回帰モデルに代わる有望な代替品として登場した。
幻覚は 信頼性を損なう重要な問題です
本研究では,これらのギャップを空間的(トケンシーケンス)と時間的(デノナイジングダイナミクス)の両方の観点から橋渡しするDynHDを提案する。
論文 参考訳(メタデータ) (2026-03-17T12:40:29Z) - HART: Data-Driven Hallucination Attribution and Evidence-Based Tracing for Large Language Models [4.211691393530721]
我々は,大規模言語モデルに対する微細な幻覚の帰属とエビデンス検索の枠組みであるHARTを提案する。
HARTは幻覚追跡を、局所化、メカニズム帰属、エビデンス検索、因果トレースの4段階からなる構造化モデリングタスクとして定式化する。
この定式化に基づいて,幻覚追跡に適した最初の構造化データセットを開発した。
論文 参考訳(メタデータ) (2026-03-06T02:23:55Z) - Scalable Contrastive Causal Discovery under Unknown Soft Interventions [3.165716101116899]
本稿では,2つの観測と干渉のペア化のためのスケーラブルな因果探索モデルを提案し,その基礎構造と未知のソフト介入について述べる。
合成データの実験では、因果構造回復の改善、保持された因果機構を持つ未知のグラフへの一般化、より大きなグラフへのスケーラビリティが示されている。
論文 参考訳(メタデータ) (2026-03-03T18:16:16Z) - CausalMamba: Interpretable State Space Modeling for Temporal Rumor Causality [4.936998293690288]
CausalMambaは、Mambaベースのシーケンスモデリング、グラフ畳み込みネットワーク(GCN)、NOTEARSによる微分因果発見を統合する新しいフレームワークである。
我々のフレームワークは、噂の分類と影響分析に統一的なアプローチを提供し、より説明しやすく行動可能な誤情報検出システムを実現する。
論文 参考訳(メタデータ) (2025-11-20T09:59:16Z) - Causal-HalBench: Uncovering LVLMs Object Hallucinations Through Causal Intervention [18.08509160653814]
LVLM(Large Vision-Language Models)は、しばしば物体の幻覚に悩まされ、画像中の物体の存在について誤った判断を下す。
我々はLVLMのオブジェクト認識シナリオに因果解析を導入し、構造因果モデル(Structure Causal Model: SCM)を確立する。
カウサル・ハルベンチ(Causal-HalBench)は、カウンターファクトのサンプルで特別に構築され、包括的な因果メトリクスと統合されたベンチマークである。
論文 参考訳(メタデータ) (2025-11-13T12:53:03Z) - Hallucination Detection in LLMs with Topological Divergence on Attention Graphs [60.83579255387347]
幻覚(Halucination)、すなわち、事実的に誤ったコンテンツを生成することは、大きな言語モデルにとって重要な課題である。
本稿では,TOHA (Topology-based HAllucination detector) をRAG設定に導入する。
論文 参考訳(メタデータ) (2025-04-14T10:06:27Z) - Spatial Reasoning with Denoising Models [49.83744014336816]
本稿では,連続変数の集合に対する推論を行うためのフレームワークを提案する。
初めて、その生成順序をデノナイジングネットワーク自体によって予測できる。
これらの結果から,特定の推論タスクの精度を1%から50%に向上させることができる。
論文 参考訳(メタデータ) (2025-02-28T14:08:30Z) - Quantifying perturbation impacts for large language models [49.1574468325115]
本稿では、頻繁な仮説テスト問題として摂動解析を再構成するフレームワークDBPAを紹介する。
摂動影響評価におけるDBPAの有効性を示すとともに,摂動解析の汎用性を示す。
論文 参考訳(メタデータ) (2024-12-01T16:13:09Z) - Gumbel Counterfactual Generation From Language Models [64.55296662926919]
対実的推論が介入と概念的に異なることを示す。
そこで本研究では,真の文字列反事実を生成するためのフレームワークを提案する。
提案手法は,従来の介入手法が望ましくない副作用を有意に生み出しているのに対し,本手法は有意義な反事実を生じさせることを示す。
論文 参考訳(メタデータ) (2024-11-11T17:57:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。