論文の概要: CanLegalRAGBench: Evaluating Retrieval-Augmented Generation on Canadian Case Law
- arxiv url: http://arxiv.org/abs/2605.30497v1
- Date: Thu, 28 May 2026 19:24:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.192259
- Title: CanLegalRAGBench: Evaluating Retrieval-Augmented Generation on Canadian Case Law
- Title(参考訳): CanLegalRAGBench:カナダの事例法における検索強化世代の評価
- Authors: Ethan Zhao, Maksym Taranukhin, Wei Cui, Moira Aikenhead, Vered Shwartz,
- Abstract要約: CanLegalRAGBench(カンレガルラGBench)は、現実的なクエリと専門的な注釈付き回答に基づくカナダの法定QAベンチマークである。
評価の結果,検索性能は設計選択に敏感であり,オープンソース埋め込みモデルとクローズドソースモデルとの競合性が示唆された。
このベンチマークが、法的RAGシステムの限界に対処する上で、継続的な進展を加速させることを期待しています。
- 参考スコア(独自算出の注目度): 14.135446337305757
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: RAG-based legal assistants have been growing in popularity, but LLM hallucinations remain a key issue and potentially undermines justice. While benchmarks have been developed to evaluate progress, many rely on synthetic queries rather than realistic legal scenarios. Moreover, Canadian law remains underrepresented in existing evaluations. To address this gap, we introduce CanLegalRAGBench, a Canadian legal QA benchmark based on realistic queries and expert-annotated answers grounded in case law. Our evaluation shows that retrieval performance is sensitive to design choices and that open-source embedding models are competitive with closed source models. However, it also reveals the limitation of automatic evaluations that penalize systems for retrieving alternative relevant documents. We also find that generated answers often diverge from gold responses, either with hallucinations or by producing overly detailed or irrelevant content, with 8-29% of claims not being supported by the retrieved documents. We hope this benchmark will help drive continued progress in addressing limitations of legal RAG systems.
- Abstract(参考訳): RAGベースの法律アシスタントは人気があるが、LLMの幻覚は依然として重要な問題であり、司法を損なう可能性がある。
ベンチマークは進歩を評価するために開発されたが、多くは現実的な法的シナリオではなく合成クエリに依存している。
さらに、カナダの法律は、既存の評価では不十分なままである。
このギャップに対処するため、ケースローに基礎を置く現実的なクエリと専門家による注釈付き回答に基づくカナダの法律QAベンチマークであるCanLegalRAGBenchを紹介します。
評価の結果,検索性能は設計選択に敏感であり,オープンソース埋め込みモデルはクローズドソースモデルと競合することがわかった。
しかし,他の文書を検索するためのシステムに罰を与える自動評価の制限も明らかにした。
また、生成した回答は、幻覚または過剰に詳細または無関係な内容を生成することによって、しばしば金の反応から分岐し、そのクレームの8~29%は、回収された文書によって支持されない。
このベンチマークが、法的RAGシステムの限界に対処する上で、継続的な進展を加速させることを期待しています。
関連論文リスト
- Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering [54.97384993676565]
複雑な国内R&D規制から派生した運用知識グラフを特徴とする,新たなベンチマークであるRegOps-Benchを用いて,レギュレーションコンプライアンスQAを形式化する。
RefWalkはクロスドキュメントの引用を横切り、マックスベースのアグリゲーションを通じてマルチビュー候補を融合させ、ソースへのクレームを明示的にマッピングするためにルールごとの属性を強制する。
論文 参考訳(メタデータ) (2026-05-28T10:38:38Z) - Fine-grained Claim-level RAG Benchmark for Law [2.807618472608]
法則などの高次領域では、検索増強生成(RAG)は、生成した応答における幻覚を緩和するために一般的に用いられる。
法的なRAGシステムの既存の評価フレームワークは、検索および生成性能の詳細な解析を行うために必要な粒度を欠いている。
ClaimRAG-LAWは、フランス語と英語をサポートする法的RAGのための包括的なデータセットであり、専門家と非専門家の両方をターゲットにしており、現実的なシナリオを反映した多様な質問タイプを含んでいる。
論文 参考訳(メタデータ) (2026-05-20T11:56:27Z) - CaseFacts: A Benchmark for Legal Fact-Checking and Precedent Retrieval [5.305110876082343]
CaseFactsは、アメリカ合衆国最高裁判所の判例に対する法的主張を検証するためのベンチマークである。
データセットは、Supported、Refuted、Overruledに分類される6,294のクレームで構成されている。
論文 参考訳(メタデータ) (2026-01-23T23:41:46Z) - PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice [67.71760070255425]
本稿では,大規模言語モデル (LLM) を評価するための実践的ベンチマークであるPLawBenchを紹介する。
PLawBenchは、13の実践的な法的シナリオにわたる850の質問で構成され、各質問には専門家が設計した評価ルーブが伴っている。
人間の専門的判断に合わせたLLMに基づく評価器を用いて,10種類の最先端のLLMを評価した。
論文 参考訳(メタデータ) (2026-01-23T11:36:10Z) - Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics [49.3262123849242]
LEGIT(LEGal Issue Trees)は,新しい大規模(24Kインスタンス)の専門家レベルの法的推論データセットである。
我々は、裁判判決を、当事者の議論と裁判所の結論の階層的な木に変換する。
論文 参考訳(メタデータ) (2025-11-30T18:32:43Z) - Hybrid Retrieval-Augmented Generation Agent for Trustworthy Legal Question Answering in Judicial Forensics [30.232667436008978]
司法設定に適した混成法的QAエージェントを提示する。
検索強化世代(RAG)とマルチモデルアンサンブルを統合し、信頼性、監査性、継続的なアップグレード可能なカウンセラーを提供する。
論文 参考訳(メタデータ) (2025-11-03T15:30:58Z) - JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking [81.88787401178378]
本稿では,文書関連性を評価する際に,人間の認知過程をエミュレートする新しいエージェント・リランカであるJiceRankを紹介する。
我々は,推論集約型BRIGHTベンチマークを用いて判定Rankを評価し,第1段階の検索手法よりも性能が大幅に向上したことを示す。
さらに、JiceRankは、人気の高いBEIRベンチマークの細調整された最先端リランカと同等に動作し、ゼロショットの一般化能力を検証している。
論文 参考訳(メタデータ) (2024-10-31T18:43:12Z) - A Comprehensive Evaluation of Large Language Models on Legal Judgment
Prediction [60.70089334782383]
大規模言語モデル(LLM)は、ドメイン固有のアプリケーションに大きな可能性を示している。
GPT-4の法律評価をめぐる近年の論争は、現実の法的タスクにおけるパフォーマンスに関する疑問を提起している。
我々は,LLMに基づく実践的ベースラインソリューションを設計し,法的判断予測の課題を検証した。
論文 参考訳(メタデータ) (2023-10-18T07:38:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。