論文の概要: Detecting Hallucinations in Retrieval-Augmented Generation through Grounding-Aware Sensitivity by Perturbation (GASP)
- arxiv url: http://arxiv.org/abs/2607.04223v1
- Date: Sun, 05 Jul 2026 10:35:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.870197
- Title: Detecting Hallucinations in Retrieval-Augmented Generation through Grounding-Aware Sensitivity by Perturbation (GASP)
- Title(参考訳): 摂動(GASP)による接地感による検索増強世代における幻覚の検出
- Abstract要約: Grounding-Aware Sensitivity by Perturbation (GASP) は、抽出された証拠にどれだけ強く依存するかによって、各回答文をスコアするスパンレベル検出器である。
GASPは、完全なコンテキスト下で修正され、コンテキストなしで再スコアされ、各チャンクが削除された後、ログライクなドロップとJensen-Shannonの発散を測定する。
2つのモデルファミリーの3つのインストラクションチューニングスコアを用いた3つのベンチマーク(RAGTruth, TofuEval, RAGBench)でGASPを評価する。
- 参考スコア(独自算出の注目度): 1.827510863075184
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented generation (RAG) reduces but does not eliminate hallucination, and existing detectors return a single answer-level score that does not indicate which sentence is unsupported, or why. To close this gap, we introduce Grounding-Aware Sensitivity by Perturbation (GASP), a span-level detector that scores each answer sentence by how strongly its likelihood depends on the retrieved evidence, a quantity we term grounding sensitivity. GASP holds the answer fixed and re-scores it under the full context, under no context, and with each chunk removed, then measures the log-likelihood drops and Jensen-Shannon divergences (JSD). The likelihood of a grounded sentence collapses once its supporting passage is removed, whereas a hallucinated sentence is almost unaffected, a contrast we interpret by casting decoding as a random nonlinear iterated function system (RNIFS). We evaluate GASP on three benchmarks (RAGTruth, TofuEval, RAGBench) with three instruction-tuned scorers from two model families (Qwen2.5-0.5B, Qwen2.5-1.5B, and SmolLM2-1.7B) under a leakage-clean protocol. On RAGTruth it reaches a response-level area under the ROC curve (AUC) of about 0.73 and a span-level AUC of about 0.67, improving significantly over perplexity and by clear margins over length, whole-context natural language inference (NLI), and self-consistency baselines. The only baseline competitive at the span level is a well-configured chunk-level entailment verifier, which requires a separate model, whereas a training-free threshold on the grounding features matches the trained classifier without labeled data and serves as the default detector. Beyond RAGTruth, the signal transfers to TofuEval but not to short-answer question answering in RAGBench, showing GASP is best suited to outputs constructed from the retrieved context rather than answers recoverable from parametric knowledge.
- Abstract(参考訳): Retrieval-augmented Generation (RAG) は減少するが幻覚を排除せず、既存の検出器はどの文がサポートされていないか、その理由を示さない単一の回答レベルスコアを返す。
このギャップを埋めるために、我々は、探索された証拠にどれだけ強く依存するかによって、各回答文をスコアするスプレッドレベル検出器であるGASP(Gunding-Aware Sensitivity by Perturbation)を紹介した。
GASPは、完全なコンテキスト下で修正され、コンテキストなしで再スコアされ、各チャンクが削除された後、ログライクなドロップとJensen-Shannon発散(JSD)を測定する。
一方,無作為な非線形反復関数系 (RNIFS) としてデコーディングをキャストすることで, 暗黙の文がほとんど影響を受けないのに対して, 接地文は崩壊する可能性が示唆された。
我々は,3つのモデルファミリ (Qwen2.5-0.5B, Qwen2.5-1.5B, SmolLM2-1.7B) をリーククリーンプロトコルで評価し, GASPを3つのベンチマーク(RAGTruth, TofuEval, RAGBench)で評価した。
RAGTruthでは、約0.73のROC曲線(AUC)と約0.67のスパンレベルAUCの応答レベル領域に到達し、難易度よりも大幅に改善され、長さよりも明確なマージン、全文脈自然言語推論(NLI)、自己整合性ベースラインとなっている。
スパンレベルで競合する唯一のベースラインは、明確に構成されたチャンクレベルの包含検証器であり、これは別のモデルを必要とするが、グラウンド機能に関するトレーニング不要のしきい値は、ラベル付きデータなしで訓練された分類器と一致し、デフォルトの検知器として機能する。
RAGTruth以外にも、信号はTofuEvalに転送されるが、RAGBenchの質問応答を短解するものではない。
関連論文リスト
- When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers [4.106593007943804]
入力に答えの要約が残るかどうかを測る軽量なスコアであるグラウンドドリフトを導入する。
次に, 説明カモフラージュストレス症例に対するマルチプローブエスカレーションであるUn Supported Groundednessを評価した。
論文 参考訳(メタデータ) (2026-08-12T22:11:47Z) - Latent Reward Registers for Diffusion Preference Alignment [46.49072106092868]
本稿では,中間雑音の遅延から端末の好みを推定するメカニズムであるLatent Reward Registersを提案する。
この独立した読み出し機構は、発電機の隠された状態や速度場を変えることなく、潜伏した報酬証拠を抽出する。
トレーニングのために、Reward-Gradient On-Policy Distillation (RG-OPD) は、標準的な政策勾配の計算的に高価なロールアウトを回避し、報酬誘導された更新をオンライン軌道に沿って蒸留する。
推論のためには、Reward-Guided Sampling (RGS) はパラメータ更新なしで大小マッチングされた報酬勾配を経由する。
論文 参考訳(メタデータ) (2026-08-04T17:00:52Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG [3.2327627739464635]
本稿では,文脈信頼度評価のための逆転型テストフレームワークRT4CHARTを提案する。
モデル出力を独立に検証可能なクレームに分解し、階層的で局所的な検証を行う。
全基準線のうち、最良回答レベル幻覚検出F1を実現する。
論文 参考訳(メタデータ) (2026-03-29T16:12:18Z) - ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning [5.725082598014574]
Retrieval-Augmented Generation (RAG) は、検索された証拠に生成を基礎づけることで、大規模言語モデルの信頼性を向上させる。
相手がパスを注入または編集して、ターゲットクエリのTop-K$結果にランク付けし、下流生成に影響を与えるようにします。
本稿では,高密度レトリバーRAGのためのポストホック,トレーニングフリーレトリバーサイドディフェンスであるProGRankを提案する。
論文 参考訳(メタデータ) (2026-03-24T08:29:15Z) - Aligning to Illusions: Choice Blindness in Human and AI Feedback [2.912535004465788]
人間の選択失明研究では、過度にスワップされた好みの91%が発見されず、選択失明は不慣れなテキストの第三者による評価比較にまで及ぶ。
検出は、真の自己監視ではなく、浅いテキストマッチングに依存している。
2つのアーキテクチャにわたる線量応答実験では、報奨信号が半減する前にラベルの6分の1から3分の1を破損させなければならない。
Best-of-N評価では、これは下流の政策劣化につながると確認されている。
論文 参考訳(メタデータ) (2026-03-09T14:10:36Z) - Rethinking the Reranker: Boundary-Aware Evidence Selection for Robust Retrieval-Augmented Generation [64.09110141948693]
Retrieval-Augmented Generation (RAG) システムは、現実的な検索ノイズの下でも不安定である。
そこで我々は,BAR-RAGを提案する。このBAR-RAGは,発電機のGoldilocks Zoneをターゲットとした境界認識型エビデンスセレクタである。
Bar-RAGはノイズ検索において、エンドツーエンドのパフォーマンスを一貫して改善する。
論文 参考訳(メタデータ) (2026-02-03T16:08:23Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Fairness Testing in Retrieval-Augmented Generation: How Small Perturbations Reveal Bias in Small Language Models [0.1876920697241348]
本研究は, 3つの小言語モデル(SLM)による感情分析における公平性を評価するために, 制御された人口変動を導入した変成試験(MT)による公平性テストを実施する。
その結果, 微少な人口変動が変成関係(MRs)の3分の1に分解できることが示唆された。
これらの失敗を詳細に分析すると、一貫したバイアス階層が示され、人種的手がかりを含む摂動が違反の主な原因となっている。
論文 参考訳(メタデータ) (2025-09-30T17:42:35Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - The KFIoU Loss for Rotated Object Detection [115.334070064346]
本稿では,SkewIoU損失とトレンドレベルアライメントを両立できる近似的損失を考案する上で,有効な方法の1つとして論じる。
具体的には、対象をガウス分布としてモデル化し、SkewIoUのメカニズムを本質的に模倣するためにカルマンフィルタを採用する。
KFIoUと呼ばれる新たな損失は実装が容易で、正確なSkewIoUよりもうまく動作する。
論文 参考訳(メタデータ) (2022-01-29T10:54:57Z) - Constructing interval variables via faceted Rasch measurement and
multitask deep learning: a hate speech application [63.10266319378212]
本稿では,教師付き深層学習と多面的ラッシュアイテム応答理論(IRT)構築手法を組み合わせることで,連続区間スペクトル上の複素変数を測定する手法を提案する。
われわれは、YouTube、Twitter、Redditから5万件のソーシャルメディアコメントを収集し、1万1000人の米国拠点のAmazon Mechanical Turkの労働者によってラベル付けされたデータセット上で、この新しい手法を実証した。
論文 参考訳(メタデータ) (2020-09-22T02:15:05Z) - Stratified Rule-Aware Network for Abstract Visual Reasoning [46.015682319351676]
Raven's Progressive Matrices (RPM) テストは一般的に抽象的推論の能力を調べるために使用される。
畳み込みニューラルネットワーク(CNN)を利用した最近の研究は、RPMテストを達成するための奨励的な進歩を達成している。
本稿では,2つの入力シーケンスに対するルール埋め込みを生成するためのSRAN(Stratified Rule-Aware Network)を提案する。
論文 参考訳(メタデータ) (2020-02-17T08:44:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。