論文の概要: LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks
- arxiv url: http://arxiv.org/abs/2606.09389v1
- Date: Mon, 08 Jun 2026 12:04:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.963106
- Title: LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks
- Title(参考訳): LexRubric: オープンエンディングな法的タスクのためのルーブリックガイド付き診断ベンチマーク
- Abstract要約: オープンな中国の法的タスクを評価するためのルーブリックベースのベンチマークであるLexRubricを紹介した。
これには、日々の法的要求と専門的な法的理由の両方を反映した、法的協議と司法試験からの649の事例が含まれる。
また、12,337人の専門家による原子鑑定基準を、統一された6次元フレームワークの下で構成している。
- 参考スコア(独自算出の注目度): 42.88450102623113
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language models (LLMs) are increasingly applied to real-world legal tasks, evaluating the reliability of their open-ended legal responses has become essential. These tasks require context-sensitive answers and allow little room for error, motivating fine-grained and diagnostic evaluation that can identify specific sources of response quality failures. We introduce LexRubric, a rubric-based benchmark for evaluating open-ended Chinese legal tasks. LexRubric contains 649 instances from legal consultation and judicial examination, which reflect both everyday legal needs and professional legal reasoning and cover 14 legal scenarios. It further includes 12,337 expert-written atomic scoring criteria organized under a unified six-dimensional framework, enabling accurate evaluation and diagnostic analysis across tasks and evaluation dimensions. To validate the reliability of the evaluation, we test multiple judge models and compare model-based judgments with human judgments. We further evaluate 18 recent general and legal-domain LLMs on LexRubric. Results show that different models exhibit distinct capability profiles, and that open-ended legal question remains challenging for current LLMs. Data is available at: https://github.com/foggpoy/LexRubric.
- Abstract(参考訳): 大規模言語モデル(LLM)が現実の法的タスクにますます適用されるにつれて、そのオープンエンドな法的応答の信頼性を評価することが不可欠になっている。
これらのタスクは、文脈に敏感な回答を必要とし、エラーの余地がほとんどなく、特定の応答品質障害の原因を特定するための、きめ細かい、そして診断的な評価を動機付ける。
オープンな中国の法的タスクを評価するためのルーブリックベースのベンチマークであるLexRubricを紹介した。
LexRubricには、日々の法的要求と専門的な法的推論の両方を反映し、14の法的シナリオをカバーしている649の事例が含まれている。
さらに、12,337人の専門家による原子鑑定基準を統合された6次元のフレームワークで構成し、タスクや評価次元の正確な評価と診断を可能にする。
評価の信頼性を検証するため,複数の判定モデルを検証し,モデルに基づく判断と人間の判断を比較した。
さらに、LexRubric上の18の一般及び法的ドメインLLMを評価した。
その結果、異なるモデルが異なる能力プロファイルを示しており、現在のLLMでは、未解決の法的問題はまだ難しいことが判明した。
データは、https://github.com/foggpoy/LexRubric.comで入手できる。
関連論文リスト
- TriBench-Ko: Evaluating LLM Risks in Judicial Workflows [10.833772229369226]
TriBench-Koは、大規模言語モデルのデプロイメントリスクを評価するために設計された韓国のベンチマークである。
要約、前例検索、法的問題抽出、証拠分析の4つのコアタスクをカバーしている。
複数のデプロイメントリスクカテゴリにわたるモデル動作を共同で評価する。
論文 参考訳(メタデータ) (2026-05-05T14:20:28Z) - AR-BENCH: Benchmarking Legal Reasoning with Judgment Error Detection, Classification and Correction [30.1142279338937]
法的判断は、事件状況の複雑さと法的概念の抽象的な性質による誤りを含むことがある。
現在の法的AI研究は、判断予測や法的文書生成のようなタスクに焦点を当てている。
本稿では,モデルの診断的推論と信頼性を法的に評価することを目的とした新しいタスクAPPELLATE REVIEWを紹介する。
論文 参考訳(メタデータ) (2026-01-30T09:22:32Z) - PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice [67.71760070255425]
本稿では,大規模言語モデル (LLM) を評価するための実践的ベンチマークであるPLawBenchを紹介する。
PLawBenchは、13の実践的な法的シナリオにわたる850の質問で構成され、各質問には専門家が設計した評価ルーブが伴っている。
人間の専門的判断に合わせたLLMに基づく評価器を用いて,10種類の最先端のLLMを評価した。
論文 参考訳(メタデータ) (2026-01-23T11:36:10Z) - LexGenius: An Expert-Level Benchmark for Large Language Models in Legal General Intelligence [74.05988707492058]
法務総合知能(ぎょうげんがく、英語: Legal General Intelligence, GI)とは、法的な理解、推論、意思決定を含む人工知能(AI)のこと。
既存のベンチマークは結果指向であり、大規模言語モデル(LLM)の法的なインテリジェンスを体系的に評価することができない。
我々は、LLMにおける法GIを評価するための専門家レベルの中国の法定ベンチマークであるLexGeniusを提案する。
論文 参考訳(メタデータ) (2025-12-04T08:48:02Z) - LEXam: Benchmarking Legal Reasoning on 340 Law Exams [76.3521146499006]
textscLEXamは,法科116科の法科試験を対象とする340件の法科試験を対象とする,新しいベンチマークである。
このデータセットは、英語とドイツ語で4,886の法試験質問で構成されており、その中には2,841の長文のオープンエンド質問と2,045の多重選択質問が含まれている。
この結果から,モデル間の差分化におけるデータセットの有効性が示唆された。
論文 参考訳(メタデータ) (2025-05-19T08:48:12Z) - Automatic Legal Writing Evaluation of LLMs [10.74636407144071]
oab-benchは、最近の試験版から7つの分野にわたる105の質問からなるベンチマークである。
Claude-3.5 Sonnetは10点中平均スコア7.93点で21点の試験に合格した。
実験の結果,OpenAIのo1のようなフロンティアモデルでは,承認試験の評価において,人間のスコアと強い相関が得られた。
論文 参考訳(メタデータ) (2025-04-29T22:16:39Z) - LegalAgentBench: Evaluating LLM Agents in Legal Domain [53.70993264644004]
LegalAgentBenchは、中国の法律領域でLLMエージェントを評価するために特別に設計されたベンチマークである。
LegalAgentBenchには、現実世界の法的シナリオから17のコーパスが含まれており、外部知識と対話するための37のツールを提供している。
論文 参考訳(メタデータ) (2024-12-23T04:02:46Z) - A Comprehensive Evaluation of Large Language Models on Legal Judgment
Prediction [60.70089334782383]
大規模言語モデル(LLM)は、ドメイン固有のアプリケーションに大きな可能性を示している。
GPT-4の法律評価をめぐる近年の論争は、現実の法的タスクにおけるパフォーマンスに関する疑問を提起している。
我々は,LLMに基づく実践的ベースラインソリューションを設計し,法的判断予測の課題を検証した。
論文 参考訳(メタデータ) (2023-10-18T07:38:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。