論文の概要: Legal Nugget Extraction for Granular Retrieval over Long Jurisprudential Texts
- arxiv url: http://arxiv.org/abs/2607.22479v1
- Date: Fri, 24 Jul 2026 16:47:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.188829
- Title: Legal Nugget Extraction for Granular Retrieval over Long Jurisprudential Texts
- Title(参考訳): 長文における粒状検索のための法的なNugget抽出法
- Abstract要約: 本稿では,ブラジルの法律資料から抽出した短文かつ自己完結した法的事項である法的なナゲットが,ブラジルの法的な収集物に対する厳密な検索を改善できるかどうかを問う。
本稿では,各文書からナゲットを抽出し,埋め込みをインデックス化し,ナゲットレベルの証拠を検索し,検索したナゲットを文書レベルのランキングに集約するパイプラインを提案する。
- 参考スコア(独自算出の注目度): 6.120106694667796
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Legal retrieval over jurisprudential collections is challenging because court decisions are long, heterogeneous documents whose relevant legal thesis may occupy only a small portion of the text. This paper asks whether legal nuggets, defined as short and self-contained legal theses extracted from source documents, can improve dense retrieval over Brazilian legal collections. We propose a pipeline that extracts nuggets from each document, indexes them with embeddings, retrieves nugget-level evidence, and aggregates the retrieved nuggets back to document-level rankings. We evaluate this approach on four Portuguese legal retrieval benchmarks from the JUA ecosystem, reporting NDCG@10, MAP@10, and MRR@10. Nugget retrieval substantially improves the two jurisprudential datasets: on JUA-Juris, NDCG@10 increases from 0.10265 to 0.20461, and on JurisTCU from 0.20898 to 0.32696. However, it underperforms full-document retrieval on NormasTCU and BR-TaxQA, and an embedding-model ablation shows that strong domain-adapted retrievers can remain better in the full-document setting. The results demonstrate that legal nuggets can be useful for jurisprudence search, especially when queries are formulated as legal theses, but they may not transfer equally well to other legal retrieval scenarios.
- Abstract(参考訳): 裁判所の決定は長く、異質な文書であり、関連する法的論文が本文のごく一部を占める可能性があるため、法学的なコレクションに対する法的検索は困難である。
本稿では,ブラジルの法律資料から抽出した短文かつ自己完結した法的事項である法的なナゲットが,ブラジルの法的な収集物に対する密集的検索を改善できるかどうかを問う。
本稿では,各文書からナゲットを抽出し,埋め込みをインデックス化し,ナゲットレベルの証拠を検索し,検索したナゲットを文書レベルのランキングに集約するパイプラインを提案する。
本手法は,JUAエコシステムの4つのポルトガル法定検索ベンチマークで評価され,NDCG@10,MAP@10,MRR@10が報告された。
JUA-Jurisでは、NDCG@10は0.10265から0.20461に増加し、JurisTCUは0.20898から0.32696に増加した。
しかし,NormasTCUとBR-TaxQAのフルドキュメント検索では性能が低下し,埋め込みモデルアブレーションにより,強力なドメイン適応型レトリバーがフルドキュメント設定で良好に維持できることが示されている。
以上の結果から,法的なナゲットは,特にクエリが法的なテナントとして定式化されている場合において,法的な検索に有用であるが,他の法的な検索シナリオに等しく転送されない可能性が示唆された。
関連論文リスト
- JUÁ -- A Benchmark for Information Retrieval in Brazilian Legal Text Collections [3.6360100966162787]
ポルトガル語の法的な情報検索は、利用可能なデータセットが文書タイプ、クエリスタイル、関連性定義で大きく異なるため、体系的に評価することが依然として困難である。
我々はブラジルの法定検索のための公開ベンチマークであるJUを、異種法定コレクション間でより再現性が高く、同等の評価をサポートするように設計された。
論文 参考訳(メタデータ) (2026-04-07T17:10:54Z) - Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics [49.3262123849242]
LEGIT(LEGal Issue Trees)は,新しい大規模(24Kインスタンス)の専門家レベルの法的推論データセットである。
我々は、裁判判決を、当事者の議論と裁判所の結論の階層的な木に変換する。
論文 参考訳(メタデータ) (2025-11-30T18:32:43Z) - Augmented Question-guided Retrieval (AQgR) of Indian Case Law with LLM, RAG, and Structured Summaries [0.0]
本稿では,関連事例の検索を容易にするためにLarge Language Models (LLMs) を提案する。
提案手法は,Retrieval Augmented Generation (RAG) と,インドの事例法に最適化された構造化要約を組み合わせたものである。
本システムは,関連事例法をより効果的に識別するために,事実シナリオに基づく対象の法的質問を生成する。
論文 参考訳(メタデータ) (2025-07-23T05:24:44Z) - LegalSearchLM: Rethinking Legal Case Retrieval as Legal Elements Generation [9.894351313663874]
LCR(Lawal Case Retrieval)は、法律専門家の基本的な課題である。
LCRに関する既存の研究は2つの大きな制限に直面している。
まず,比較的小規模な検索コーパスを用いて評価を行った。
第二に、埋め込み方式や語彙マッチング方式への依存は、しばしば限定的な表現と法的に無関係な一致をもたらす。
論文 参考訳(メタデータ) (2025-05-28T09:02:41Z) - BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval [54.54576644403115]
BRIGHTは、関係する文書を検索するために、集中的推論を必要とする最初のテキスト検索ベンチマークである。
私たちのデータセットは、経済学、心理学、数学、コーディングなど、さまざまな領域にまたがる1,384の現実世界のクエリで構成されています。
クエリに関する明示的な推論を取り入れることで、検索性能が最大12.2ポイント向上することを示す。
論文 参考訳(メタデータ) (2024-07-16T17:58:27Z) - CLERC: A Dataset for Legal Case Retrieval and Retrieval-Augmented Analysis Generation [44.67578050648625]
我々は、大規模なオープンソース法定コーパスを、情報検索(IR)と検索拡張生成(RAG)をサポートするデータセットに変換する。
このデータセットCLERCは、(1)法的な分析のための対応する引用を見つけ、(2)これらの引用のテキストを、推論目標を支持するコジェント分析にコンパイルする能力に基づいて、モデルのトレーニングと評価のために構築される。
論文 参考訳(メタデータ) (2024-06-24T23:57:57Z) - STARD: A Chinese Statute Retrieval Dataset with Real Queries Issued by Non-professionals [14.002280587675175]
ルール検索は、特定のクエリに関する関連する法定項目を見つけることを目的としている。
既存の法定検索ベンチマークは、司法試験や訴訟文書などのソースからの形式的および専門的なクエリに焦点を当てている。
このギャップに対処するため、STAtute Retrieval データセット(STARD)を導入します。
既存の法定検索データセットとは異なり、STARDは一般からの実際のクエリの複雑さと多様性をキャプチャする。
論文 参考訳(メタデータ) (2024-06-21T17:10:09Z) - MUSER: A Multi-View Similar Case Retrieval Dataset [65.36779942237357]
類似事例検索(SCR)は、司法公正の促進に重要な役割を果たす代表的法的AIアプリケーションである。
既存のSCRデータセットは、ケース間の類似性を判断する際にのみ、事実記述セクションにフォーカスする。
本稿では,多視点類似度測定に基づく類似事例検索データセットMと,文レベル法定要素アノテーションを用いた包括的法定要素を提案する。
論文 参考訳(メタデータ) (2023-10-24T08:17:11Z) - DAPR: A Benchmark on Document-Aware Passage Retrieval [57.45793782107218]
我々は,このタスクemphDocument-Aware Passage Retrieval (DAPR)を提案する。
State-of-The-Art(SoTA)パスレトリバーのエラーを分析しながら、大きなエラー(53.5%)は文書コンテキストの欠如に起因する。
提案するベンチマークにより,検索システムの開発・比較を今後行うことができる。
論文 参考訳(メタデータ) (2023-05-23T10:39:57Z) - SAILER: Structure-aware Pre-trained Language Model for Legal Case
Retrieval [75.05173891207214]
判例検索は知的法体系において中心的な役割を果たす。
既存の言語モデルの多くは、異なる構造間の長距離依存関係を理解するのが難しい。
本稿では, LEgal ケース検索のための構造対応プレトランザクショナル言語モデルを提案する。
論文 参考訳(メタデータ) (2023-04-22T10:47:01Z) - A Statutory Article Retrieval Dataset in French [4.082216579462797]
ベルギー法令検索データセット(BSARD)について紹介する。
BSARDは、経験豊富な法学者によってラベル付けされた1,100以上のフランス原住民の法的問題と、22,600以上のベルギー法記事のコーパスから関連する記事で構成されている。
項重み付けとプール埋め込みに基づく教師なし情報検索手法のベンチマークを行った。
私たちの最高のパフォーマンスベースラインは50.8%のR@100を達成しています。
論文 参考訳(メタデータ) (2021-08-26T13:50:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。