論文の概要: How Much Do Legal RAG Systems Still Hallucinate?
- arxiv url: http://arxiv.org/abs/2608.14210v1
- Date: Fri, 14 Aug 2026 11:39:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.368031
- Title: How Much Do Legal RAG Systems Still Hallucinate?
- Title(参考訳): 法的なRAGシステムは、まだ幻覚的か?
- Abstract要約: 本報告では, 幻覚密度と重症度について報告し, 質問カテゴリとユーザペルソナをまたいだパフォーマンスを解析し, 142件の法的専門知識を有する質問に対して, 調査結果を検証した。
否定すべき誤った仮定を含む疑似前提の質問は、手書きの質問に対して高い幻覚率をもたらす。
- 参考スコア(独自算出の注目度): 2.807618472608
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hallucination is a major challenge for retrieval-augmented generation (RAG) systems in the legal domain, where ungrounded answers can lead to serious consequences. To better understand this problem, we conduct a fine-grained analysis of hallucination behavior in eight legal RAG systems across two legal corpora, the GDPR (in English) and a national civil law (in French). Using claim-level and answer-level evaluation, we report on hallucination density and severity, analyze performance across question categories and user personas, and validate our findings on an independent set of 142 legal-expert-authored questions. Our results show that hallucinations remain pervasive, ranging from less than 10% of responses for the best-performing systems to nearly half in the worst case. We further find that false-premise questions, containing incorrect assumptions that must be rejected, produce high hallucination rates on the manually-drafted questions.
- Abstract(参考訳): 幻覚は法域における検索増強世代(RAG)システムにとって大きな課題であり、未解決の回答が重大な結果をもたらす可能性がある。
この問題をより深く理解するために、我々は、GDPR(英語)と国民民法(フランス語)という2つの法定コーパスにまたがる8つの法定RAGシステムにおける幻覚行動のきめ細かい分析を行う。
クレームレベルと回答レベルの評価を用いて,幻覚密度と重大度について報告し,質問カテゴリとユーザペルソナをまたいだパフォーマンスを分析し,法的に専門的な142の質問に対して,我々の調査結果を検証した。
その結果,最も優れたシステムに対する回答の10%未満から最悪の場合の半数近くまで,幻覚は広範に広まっています。
さらに、不正確な仮定を含む疑似前提質問が、手書きの質問に対して高い幻覚率をもたらすことが判明した。
関連論文リスト
- SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs [52.03164192840023]
LVLM(Large Vision-Language Models)は、いまだ幻覚に悩まされている。
本稿では,スケーラブルで制御可能で多様な評価データを生成する自動データ構築パイプラインを提案する。
我々は,忠実度と事実性幻覚の両方を評価するためのベンチマークであるSHALEを構築した。
論文 参考訳(メタデータ) (2025-08-13T07:58:01Z) - Beyond Facts: Evaluating Intent Hallucination in Large Language Models [13.315302240710164]
FAITHQAは20,068問題を含む意図幻覚の新しいベンチマークである。
我々は、最先端のモデルにおいても意図幻覚は一般的な問題であると考えている。
意図の幻覚を検出するための自動LLM生成評価指標であるCONSTRAINT SCOREを導入する。
論文 参考訳(メタデータ) (2025-06-06T21:10:55Z) - C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation [58.40263551616771]
本稿では,いくつかの知識文書に基づいて,詳細なQAデータセットを自動的に構築するエージェントフレームワークであるHaluAgentを紹介する。
本実験は,手作業で設計したルールと迅速な最適化により,生成データの品質が向上できることを実証する。
論文 参考訳(メタデータ) (2025-04-14T12:21:55Z) - Fine-tuning Large Language Models for Improving Factuality in Legal Question Answering [30.795942355722797]
幻覚(英: Hallucination、または誤った情報や偽造情報の生成)は、大きな言語モデルにおいて重要な課題である。
行動クローニングと新しいハードサンプル認識反復的直接選好最適化(HIPO)を統合した幻覚緩和手法を提案する。
本研究は,新たに提案された非半減期統計率など,様々な指標において顕著な改善を示すものである。
論文 参考訳(メタデータ) (2025-01-11T12:08:15Z) - A Unified Hallucination Mitigation Framework for Large Vision-Language Models [18.595958586621943]
幻覚緩和のための統一的な枠組みであるデンティストを提示する。
中心となるステップは、まずクエリを分類し、次に分類結果に基づいて幻覚緩和の異なるプロセスを実行することである。
MMbenchでは、画像品質の精度が13.44%/10.2%/15.8%向上した。
論文 参考訳(メタデータ) (2024-09-24T22:36:58Z) - Halu-J: Critique-Based Hallucination Judge [22.79828961875684]
批判に基づく幻覚判断器であるHalu-Jを紹介する。
Halu-Jは、関連する証拠を選択し、詳細な批評を提供することで幻覚の検出を強化する。
実験の結果,Hlu-J は GPT-4o よりも多値幻覚検出に優れていた。
論文 参考訳(メタデータ) (2024-07-17T18:21:01Z) - ANAH-v2: Scaling Analytical Hallucination Annotation of Large Language Models [65.12177400764506]
大規模言語モデル (LLM) は、様々な領域や広範囲のアプリケーションにまたがる、長い形式の質問応答タスクにおいて幻覚を示す。
現在の幻覚検出と緩和データセットはドメインやサイズによって制限されている。
本稿では,幻覚アノテーションデータセットを同時に,段階的にスケールアップする反復的自己学習フレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-05T17:56:38Z) - Hallucination Detection: Robustly Discerning Reliable Answers in Large Language Models [70.19081534515371]
大規模言語モデル(LLM)は様々な自然言語処理タスクで広く採用されている。
それらは、入力源から逸脱する不信または矛盾したコンテンツを生成し、深刻な結果をもたらす。
本稿では,LLMの生成した回答の幻覚を効果的に検出するために,RelDという頑健な識別器を提案する。
論文 参考訳(メタデータ) (2024-07-04T18:47:42Z) - Fine-grained Hallucination Detection and Editing for Language Models [109.56911670376932]
大規模言語モデル(LM)は、しばしば幻覚と呼ばれる事実的誤りを引き起こす傾向にある。
我々は,幻覚の包括的分類を導入し,幻覚が多様な形態で現れることを議論する。
本稿では, 幻覚自動検出のための新しいタスクを提案し, 新たな評価ベンチマークであるFavaBenchを構築した。
論文 参考訳(メタデータ) (2024-01-12T19:02:48Z) - Towards Mitigating Hallucination in Large Language Models via
Self-Reflection [63.2543947174318]
大規模言語モデル(LLM)は、質問応答(QA)タスクを含む生成的および知識集約的なタスクを約束している。
本稿では,広範に採用されているLCMとデータセットを用いた医療再生QAシステムにおける幻覚現象を解析する。
論文 参考訳(メタデータ) (2023-10-10T03:05:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。