論文の概要: From Legal Text to Executable Decision Models: Evaluating Structured Representations for Legal Decision Model Generation
- arxiv url: http://arxiv.org/abs/2604.17153v1
- Date: Sat, 18 Apr 2026 21:36:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.361471
- Title: From Legal Text to Executable Decision Models: Evaluating Structured Representations for Legal Decision Model Generation
- Title(参考訳): 法文から実行可能決定モデル:法定決定モデル生成のための構造化表現の評価
- Abstract要約: 我々は、オランダ環境計画法(Dutch Environment and Planning Act)の法的テキストとプロダクショングレードの意思決定モデルを組み合わせた、ユニークな実世界のデータセットを使用します。
これらのモデルがOmgevingsloket政府プラットフォームを支えており、市民は環境活動の許可要件を確認する。
中間構造表現は法的テキストからLLMに基づく決定モデルの生成を改善することができるかを検討する。
- 参考スコア(独自算出の注目度): 0.3519650551107762
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Transforming legal text into executable decision logic is a longstanding challenge in legal informatics. With the rise of LLMs, this task has gained renewed interest, but remains challenging due to requiring extensive manual coding and evaluation. We use a unique real-world dataset that pairs production-grade decision models with legal text from the Dutch Environment and Planning Act. These models power the Omgevingsloket government platform, where citizens check permit requirements for environmental activities. We study whether intermediate structured representations can improve LLM-based generation of executable decision models from legal text. We compare four input conditions: raw legal text, text enriched with semantic role labels, text enriched with input and output constraints, and text enriched with both. We evaluate along two dimensions: structural evaluation, through similarity to gold decision models with graph kernels and graphs' descriptive statistics, and outcome evaluation, through functional equivalence by executing models on pre-configured test scenarios. Our findings show that I/O constraints provide the dominant improvement (+37-54% similarity over baseline), while semantic role labels show modest improvements. Outcome evaluation shows that generated models match the gold standard on 51-53% of test scenarios, even though generated models are typically smaller and simpler. We find LLMs eliminate redundant pass-through logic that comprises up to 45-55% of nodes. Importantly, structural similarity and outcome equivalence are complementary: structural similarity does not guarantee outcome equivalence, and vice versa. To facilitate reproducibility, we publicly release our dataset of 95 production decision models with associated legal text and all experimental code.
- Abstract(参考訳): 法的テキストを実行可能な決定論理に変換することは、法的情報学における長年の課題である。
LLMの台頭に伴い、このタスクは新たな関心を集めているが、広範囲な手作業によるコーディングと評価を必要とするため、依然として困難である。
私たちは、オランダ環境計画法(Dutch Environment and Planning Act)の法的テキストとプロダクショングレードの意思決定モデルを組み合わせた、ユニークな実世界のデータセットを使用します。
これらのモデルがOmgevingsloket政府プラットフォームを支えており、市民は環境活動の許可要件を確認する。
中間構造表現は法的テキストからLLMに基づく決定モデルの生成を改善することができるかを検討する。
4つの入力条件を比較する: 原文, 意味的役割ラベルに富んだテキスト, 入力制約と出力制約に富んだテキスト, 両方を豊かにしたテキスト。
グラフカーネルとグラフの記述統計を用いたゴールド決定モデルとの類似性による構造評価と,事前設定されたテストシナリオのモデルの実行による機能的等価性による結果評価の2つの側面に沿って評価する。
以上の結果から,I/O制約はベースラインよりも優位な改善(+37-54%の類似性)を示し,セマンティックロールラベルは控えめな改善が見られた。
アウトカム評価は、生成されたモデルは通常小さく、よりシンプルであるにもかかわらず、51~53%のテストシナリオで生成されたモデルがゴールドスタンダードと一致していることを示している。
LLMは最大45-55%のノードからなる冗長なパススルーロジックを排除している。
重要なことに、構造的類似性と結果の等価性は相補的であり、構造的類似性は結果の等価性を保証しない。
再現性を高めるため、法文と実験コードを含む95の生産決定モデルのデータセットを公開します。
関連論文リスト
- ANNOTARES: A Dataset for Extracting Logical Structures from German Statutory Texts [4.897636783430679]
本稿では,ドイツ法典に法的条件 (Tatbestand) と法的結果 (Rechtsfolge) を識別・分節する作業を紹介する。
この課題を支援するために,ドイツ法文とスパンレベルアノテーションを組み合わせた新しいデータセットAnnoTARESを提案する。
論文 参考訳(メタデータ) (2026-08-04T16:28:53Z) - DECODEM: Data Extraction from Corporate Organizational Documents via Enhanced Methods [2.0789144738685956]
本稿では,組織文書からコーポレートガバナンス変数の自動抽出を評価するためのベンチマークデータセットであるDECODEMを紹介する。
ベンチマークでは、ランダムにサンプル化した企業憲章と、実証的な作業でよく研究されるさまざまなガバナンス条項をカバーする高品質な人事アノテーションが組み合わされた。
その結果, 自動抽出は多くの条件に対して高い精度で実現可能であり, アプローチを横断する上界付近では中央値の性能が向上することが示唆された。
論文 参考訳(メタデータ) (2026-07-17T11:48:31Z) - ViLegalNLI: Natural Language Inference for Vietnamese Legal Texts [5.44919589318124]
本稿では,ベトナムの法律ドメイン用に構築されたベトナム初の大規模自然言語推論データセットであるViLegalNLIを紹介する。
データセットは、公式な法定文書から派生した42,012の前提-仮説ペアで構成され、バイナリ推論ラベルで注釈付けされている。
多言語モデル、ベトナム固有の事前訓練言語モデル、命令調整された大規模言語モデルを用いて、ViLegalNLI上で広範囲にわたる実験を行う。
論文 参考訳(メタデータ) (2026-04-30T18:16:14Z) - LLMStructBench: Benchmarking Large Language Model Structured Data Extraction [1.338174941551702]
LLM(Large Language Models)の評価のための新しいベンチマークを提案する。
私たちのオープンデータセットは、さまざまな複雑さの多様な手作業による解析シナリオで構成されています。
モデルサイズなどの標準属性よりも適切なプロンプト戦略を選択することが重要であることを示す。
論文 参考訳(メタデータ) (2026-02-16T13:37:58Z) - Modeling the Diachronic Evolution of Legal Norms: An LRMoo-Based, Component-Level, Event-Centric Approach to Legal Knowledge Graphs [0.0]
本稿では,このニーズに対処するため,LRMoo内に構築された時間的モデリングパターンを提案する。
本稿では,このイベント生成アーキテクチャが,特定の日に存在した法文の任意の部分の正確かつ決定論的検索と再構築を可能にする方法を示す。
論文 参考訳(メタデータ) (2025-06-09T15:18:36Z) - An Ontology-Driven Graph RAG for Legal Norms: A Structural, Temporal, and Deterministic Approach [0.0]
標準、平文検索は、法の階層的、横行的、因果的構造に盲目である。
本稿では,法則の形式構造とダイアクロニックな性質を明示的にモデル化することにより,これらの制約を克服するためのオントロジー駆動型フレームワークSAT-Graph RAGを紹介する。
論文 参考訳(メタデータ) (2025-04-29T18:36:57Z) - Attribution analysis of legal language as used by LLM [0.0]
公開可能な2つの法的データセット、より単純な二項分類タスク、および保持者の司法判断を特定するためのより精巧な複数の選択タスクを使用します。
すべてのモデルがケースホールドタスクからテスト例を正しく分類しているのに対して、他の例は1つ、モデル、属性のみによってのみ識別できる。
論文 参考訳(メタデータ) (2025-01-28T22:48:29Z) - Analysing Zero-Shot Readability-Controlled Sentence Simplification [54.09069745799918]
本研究では,異なる種類の文脈情報が,所望の可読性を持つ文を生成するモデルの能力に与える影響について検討する。
結果から,全ての試験されたモデルは,原文の制限や特徴のため,文の簡略化に苦慮していることがわかった。
実験では、RCTSに合わせたより良い自動評価指標の必要性も強調した。
論文 参考訳(メタデータ) (2024-09-30T12:36:25Z) - CLOMO: Counterfactual Logical Modification with Large Language Models [109.60793869938534]
本稿では,新しいタスク,CLOMO(Counterfactual Logical Modification)と高品質な人間アノテーションベンチマークを紹介する。
このタスクでは、LLMは所定の論理的関係を維持するために、与えられた議論的テキストを順応的に変更しなければなりません。
LLMの自然言語出力を直接評価する革新的な評価指標である自己評価スコア(SES)を提案する。
論文 参考訳(メタデータ) (2023-11-29T08:29:54Z) - Generative Judge for Evaluating Alignment [84.09815387884753]
本稿では,これらの課題に対処するために,13Bパラメータを持つ生成判断器Auto-Jを提案する。
我々のモデルは,大規模な実環境シナリオ下でのユーザクエリとLLM生成応答に基づいて訓練されている。
実験的に、Auto-Jはオープンソースモデルとクローズドソースモデルの両方を含む、強力なライバルのシリーズを上回っている。
論文 参考訳(メタデータ) (2023-10-09T07:27:15Z) - Large Language Models are Diverse Role-Players for Summarization
Evaluation [82.31575622685902]
文書要約の品質は、文法や正しさといった客観的な基準と、情報性、簡潔さ、魅力といった主観的な基準で人間の注釈者によって評価することができる。
BLUE/ROUGEのような自動評価手法のほとんどは、上記の次元を適切に捉えることができないかもしれない。
目的と主観の両面から生成されたテキストと参照テキストを比較し,総合的な評価フレームワークを提供するLLMに基づく新しい評価フレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-27T10:40:59Z) - WiCE: Real-World Entailment for Claims in Wikipedia [63.234352061821625]
We propose WiCE, a new fine-fine textual entailment dataset built on natural claim and evidence pairs from Wikipedia。
標準クレームレベルのエンターメントに加えて、WiCEはクレームのサブ文単位に対するエンターメント判断を提供する。
我々のデータセットの真のクレームは、既存のモデルで対処できない検証と検索の問題に挑戦することを含んでいる。
論文 参考訳(メタデータ) (2023-03-02T17:45:32Z) - MURMUR: Modular Multi-Step Reasoning for Semi-Structured Data-to-Text
Generation [102.20036684996248]
多段階推論を用いた半構造化データからテキストを生成するための,ニューロシンボリックなモジュラーアプローチであるMURMURを提案する。
WebNLG や LogicNLG のような2つのデータ・テキスト生成タスクについて実験を行った。
論文 参考訳(メタデータ) (2022-12-16T17:36:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。