論文の概要: Classifying Interpretive Canons at the Sentence Level: A Benchmark from the German Federal Constitutional Court
- arxiv url: http://arxiv.org/abs/2609.26945v1
- Date: Tue, 22 Sep 2026 18:34:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.729464
- Title: Classifying Interpretive Canons at the Sentence Level: A Benchmark from the German Federal Constitutional Court
- Title(参考訳): 文レベルにおける解釈的カノンの分類--ドイツ連邦憲法裁判所のベンチマークから
- Abstract要約: 本稿では,大言語モデルによる解釈カノンの分類能力を評価するための文レベルベンチマークを提案する。
我々は,ドイツ連邦憲法裁判所の判決を文レベルで注釈したデータセットを提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Judicial reasoning remains challenging for large language models (LLMs) to analyze. This paper contributes a sentence-level benchmark for evaluating the ability of LLMs to classify interpretive canons as articulated by Larenz in the tradition of Savigny. Our contributions are threefold. First, we operationalize this conception of interpretation as classification criteria. Second, we provide a dataset of decisions of the German Federal Constitutional Court annotated at the sentence level. Third, we report baseline evaluations of four LLMs from three model families under expert hand-written prompts, compared against prompts optimized with Genetic-Pareto (GEPA). Mean F1 over the seven binary subtasks clusters between 70.4 and 79.2 across models, with grammatical interpretation usually the easiest canon to identify and systematic interpretation usually the hardest; under the tested configuration, GEPA-optimized prompts do not systematically outperform the hand-written ones, suggesting that the expert prompts provide a meaningful baseline.
- Abstract(参考訳): 大規模言語モデル(LLM)が分析する上で、司法的推論は依然として困難である。
本稿では,Savigny の伝統において Larenz が記述した解釈カノンを分類する LLM の能力を評価するための文レベルベンチマークを提案する。
私たちの貢献は3倍です。
まず,この解釈概念を分類基準として運用する。
第2に,ドイツ連邦憲法裁判所の判決のデータセットを文レベルで提示する。
第3に,手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手書き手読み手読み手書き手読み手書き手読み手書き手読み手読み手読み手読み手読み手読み手書き手読み手読み手読み手読み手読み手読み手読み手読み,,手読み手読み手読み手読み手読み手
モデル間で70.4から79.2の間の7つのバイナリサブタスククラスタ上の平均F1は、文法的解釈が通常最も容易に識別でき、体系的な解釈が最も難しい。
関連論文リスト
- Small Language Models as Judges for Rubric-Based Reinforcement Learning [57.707881387886516]
より小型の言語モデルが,より効率的かつ信頼性の高いルーリック・ベース・ジャッジとして機能するかどうかを考察する。
生成的評定,Yes/No Logprobマージン,Probe judgesの3つの基準レベルの判断を,小モデルから抽出する方法を比較した。
どちらのデータセットでも、Qwen3-1.7B Probeの審査員はこれらの方法の中で最強の基準レベルの合意を達成している。
論文 参考訳(メタデータ) (2026-08-30T20:00:17Z) - Towards Explainable Adjudicative Variance: Quantifying Judicial Discretion via Gated Multi-Task Learning [9.159064044398315]
法的結果予測は、客観的事件事実を判断的文脈から切り離さなければならない。
本稿では,この区別を明示的にモデル化した判断学習型マルチタスク学習アーキテクチャを提案する。
13,937イギリス雇用裁判所の決定に対する我々のアプローチを評価した。
論文 参考訳(メタデータ) (2026-06-25T14:14:27Z) - LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening [69.1037790901185]
現実的な状況シナリオから構築した中国の論理的推論ベンチマークLLMEval-Logicを提案する。
パイプラインのフォワードオーサとエキスパート-オーディット 自然言語アイテムは、参照の形式化とともに、Z3による注釈付き回答を検証し、自然言語から形式へのグレーディングのためのエキスパートルーブリックを構築し、クローズドループの逆行ワークフローを通じて選択されたアイテムを硬化させる。
論文 参考訳(メタデータ) (2026-05-19T09:40:29Z) - Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning [11.842866992683158]
既存のLLMベースのシステムは、表面レベルのテキスト解析に優れるが、原理的合理性に必要な保証は欠如している。
本稿では,LSM エージェントと SMT ソルバ支援法則を組み合わせた新しいフレームワーク L4M を紹介する。
我々のシステムは、GPT-o4-mini、DeepSeek-V3、Claude 4、最先端の法務AI証明など、先進的なLCMを超えている。
論文 参考訳(メタデータ) (2025-11-26T04:05:06Z) - JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking [81.88787401178378]
本稿では,文書関連性を評価する際に,人間の認知過程をエミュレートする新しいエージェント・リランカであるJiceRankを紹介する。
我々は,推論集約型BRIGHTベンチマークを用いて判定Rankを評価し,第1段階の検索手法よりも性能が大幅に向上したことを示す。
さらに、JiceRankは、人気の高いBEIRベンチマークの細調整された最先端リランカと同等に動作し、ゼロショットの一般化能力を検証している。
論文 参考訳(メタデータ) (2024-10-31T18:43:12Z) - Evaluating Human Alignment and Model Faithfulness of LLM Rationale [66.75309523854476]
大規模言語モデル(LLM)が,その世代を理論的にどのように説明するかを考察する。
提案手法は帰属に基づく説明よりも「偽り」が少ないことを示す。
論文 参考訳(メタデータ) (2024-06-28T20:06:30Z) - Pragmatic Competence Evaluation of Large Language Models for the Korean Language [0.6757476692230009]
本研究では,Large Language Models (LLMs) が,特に韓国語における実践的視点から,文脈依存表現をいかによく理解しているかを評価する。
自動評価にはMultiple-Choice Questions(MCQ)と、専門家によるOEQ(Open-Ended Questions)の両方を用いる。
論文 参考訳(メタデータ) (2024-03-19T12:21:20Z) - Sentiment Analysis through LLM Negotiations [58.67939611291001]
感情分析の標準的なパラダイムは、単一のLCMに依存して、その決定を1ラウンドで行うことである。
本稿では,感情分析のためのマルチLLMネゴシエーションフレームワークを提案する。
論文 参考訳(メタデータ) (2023-11-03T12:35:29Z) - CEFR-Based Sentence Difficulty Annotation and Assessment [25.71796445061561]
CEFRベースのSentence Profile (CEFR-SP) コーパスには、共通ヨーロッパ参照言語フレームワークに基づいた17kの英語文が注釈付けされている。
本研究では, マクロF1スコアの84.5%をレベルアセスメントで達成し, 可読性評価において強いベースラインを達成できた。
論文 参考訳(メタデータ) (2022-10-21T07:03:30Z) - On the Limitations of Cross-lingual Encoders as Exposed by
Reference-Free Machine Translation Evaluation [55.02832094101173]
クロスランガルエンコーダの評価は通常、教師付き下流タスクにおけるゼロショットのクロスランガル転送または教師なしのクロスランガル類似性によって行われる。
本稿では、ソーステキストと(低品質な)システム翻訳を直接比較するMT(Reference-free Machine Translation)の評価について述べる。
事前学習したM-BERTとLASERで得られた最先端の言語間セマンティック表現に基づいて,様々なメトリクスを体系的に検討する。
参照なしMT評価において,セマンティックエンコーダとしての性能は低く,その2つの重要な限界を同定する。
論文 参考訳(メタデータ) (2020-05-03T22:10:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。