論文の概要: Why RAGs Hallucinate: Penalty-Aware Evaluation of Retrieval-Augmented Generation Systems with Knowledge-Gap Canaries
- arxiv url: http://arxiv.org/abs/2608.26385v1
- Date: Wed, 26 Aug 2026 20:17:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.172614
- Title: Why RAGs Hallucinate: Penalty-Aware Evaluation of Retrieval-Augmented Generation Systems with Knowledge-Gap Canaries
- Title(参考訳): RAGが幻覚する理由 : 知識ギャップカナリアを用いた検索型生成システムのペナルティ意識評価
- Authors: Alden Do Rosario, Hussein Younes, Felipe Pires,
- Abstract要約: Volume-based accuracys rewards search-augmented generation (RAG) system for guessing。
デプロイされたRAG製品に対するペナルティ対応評価フレームワークを提案する。
回答の精度はシステム間で密集している(97.0-98.0%)のに対し、カナリア違反率はおよそ6倍(16.7%対98.1%)である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Volume-based accuracy rewards retrieval-augmented generation (RAG) systems for guessing: a system that answers everything outscores one that declines when its knowledge base cannot support an answer. Building on the confidence-target analysis of Kalai et al. (2025), we present a penalty-aware evaluation framework for deployed RAG products, combining (i) asymmetric scoring (correct +1, wrong -4, abstain 0), (ii) knowledge-gap canaries, questions whose answers are verifiably absent from the knowledge base, so that any answer constitutes ungrounded generation from parametric memory, and (iii) a failure-attribution pipeline that separates retrieval, generation, and abstention-policy failures. Applying the framework to three commercial RAG systems and a no-retrieval baseline on SimpleQA-Verified (1,000 questions x 3 repeats, graded blind by a cross-family three-judge panel with 98.9% unanimity), we find that accuracy when answering is closely clustered across systems (97.0-98.0%), while canary violation rates differ roughly sixfold (16.7% vs. 98.1%). The systems are separated less by what they answer correctly than by whether they answer at all when they should not, and penalty-aware scoring reorders the volume-based ranking accordingly; the reordering is stable across penalty settings from k=1 to k=9. All code, configurations, transcripts, and judge votes are released for independent audit.
- Abstract(参考訳): ボリュームベースの精度は、検索強化世代(RAG)システムに対して、すべての質問に答えるシステムは、その知識ベースが答えをサポートできない場合に低下する。
Kalai et al(2025)の信頼性目標分析に基づいて、デプロイされたRAG製品に対するペナルティ対応評価フレームワークを提案する。
(i)非対称スコア(正しい+1、間違った-4、控え 0)
二 ナレッジギャップカナリア、ナレッジベースから答えが確実に欠落している質問であって、任意の回答がパラメトリックメモリから根拠のない生成を構成すること。
(iii)検索、生成、棄権政治失敗を分離するフェール・アトリビューション・パイプライン。
3つの商用RAGシステムにフレームワークを適用し、SimpleQA-Verified(1000の質問 x 3の繰り返し、98.9%の共通性を持つクロスファミリーの3つのジャッジパネルで目が見えない)に非検索ベースラインを適用すると、回答の正確さはシステム間で密集している(97.0-98.0%)が、カナリア違反率はおよそ6倍(16.7%対98.1%)。
システムは、答えるべきでないときに答えるかどうかよりも、正しい解答によって分離され、ペナルティを意識したスコアリングは、ボリュームベースのランキングを順に並べ替え、k=1からk=9までのペナルティ設定で安定している。
すべてのコード、構成、書き起こし、および審査票は、独立した監査のために解放される。
関連論文リスト
- Towards Expert Financial QA via Self-Improving RAG [2.1042118213583394]
自己改善RAGは文書QAを3つの特殊エージェントに分解するフレームワークである。
Retrieval, Reasoning, judgeは、フィードバック駆動の自己補正を備えたオーケストレータによって調整される。
我々は、自己改善RAGが約86%のオラクル誘導精度を36.4%のラザラスレートで達成するファイナンスベンチ(SECの申請QA)を評価する。
論文 参考訳(メタデータ) (2026-08-27T07:01:41Z) - Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG [0.0]
本稿では,ソースグラウンドRAGのための制御メタ評価プロトコルであるEval-Pair Matrixを紹介する。
GPT,Grok,Geminiモデルを用いた摂動通路から解答を生成し,視覚障害者と同じモデルを用いて各解答を元の解答に対して評価する。
実験には300個のコアレコード、897個のラベル付きジェネレータ出力、および2,683個の判定結果が含まれている。
論文 参考訳(メタデータ) (2026-07-12T07:39:45Z) - When Confidence Takes the Wrong Path: Diagnosing Retrieval-State Lock-In in RAG [0.0]
多くのブラックボックスの不確実性法は、まだサンプル回答間の合意を自信として読んでいる。
問題は、デプロイされたRAGで認識されるが、名前、測定可能なシグネチャ、および有病率境界が欠落している。
故障検索状態のロックインを命名し、3つのオブジェクトを1つの信頼スコアが混在して診断する。
論文 参考訳(メタデータ) (2026-06-22T00:08:00Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation [6.604874054866016]
本稿では,証拠満足度がセットレベル特性であることを示す,透過的なアグリゲーションプロトコルSURE-RAGを提案する。
共有ペアレベルのクレームエビデンス検証器は、SURE-RAGが集約した局所的関係分布を解釈可能な応答レベル信号に生成する。
制御されたマルチホップベンチマークであるHotpotQA-RAG v3をアーティファクト・アウェア・プロトコルで評価した。
論文 参考訳(メタデータ) (2026-05-05T09:05:40Z) - Evaluating Retrieval-Augmented Generation Systems on Unanswerable, Uncheatable, Realistic, Multi-hop Queries [53.99620546358492]
実世界のユースケースでは、複雑なクエリを持つRAGシステムが存在し、関連する情報がコーパスから欠落したり、不完全であったりすることが多い。
既存のRAGベンチマークは、マルチホップやスコープ外の質問に対して、現実的なタスクの複雑さを反映することはめったにない。
un$underlinec$heatable, $underliner$ealistic, $underlineu$nanswerable, $underlinem$ulti-hopの自動生成のための最初のパイプラインを提示する。
論文 参考訳(メタデータ) (2025-10-13T21:38:04Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Do RAG Systems Cover What Matters? Evaluating and Optimizing Responses with Sub-Question Coverage [74.70255719194819]
サブクエストカバレッジに基づく新しいフレームワークを導入し、RAGシステムが質問の異なる面にどのように対処するかを計測する。
このフレームワークを使用して、You.com、Perplexity AI、Bing Chatの3つの商用生成応答エンジンを評価します。
すべての回答エンジンは、バックグラウンドやフォローアップよりも、コアサブクエストを頻繁にカバーしていますが、コアサブクエストの約50%を見逃しています。
論文 参考訳(メタデータ) (2024-10-20T22:59:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。