論文の概要: From Legal Text to Executable Decision Models: Evaluating Structured Representations for Legal Decision Model Generation
- arxiv url: http://arxiv.org/abs/2604.17153v1
- Date: Sat, 18 Apr 2026 21:36:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.361471
- Title: From Legal Text to Executable Decision Models: Evaluating Structured Representations for Legal Decision Model Generation
- Title(参考訳): 法文から実行可能決定モデル:法定決定モデル生成のための構造化表現の評価
- Authors: David Graus,
- Abstract要約: 我々は、オランダ環境計画法(Dutch Environment and Planning Act)の法的テキストとプロダクショングレードの意思決定モデルを組み合わせた、ユニークな実世界のデータセットを使用します。
これらのモデルがOmgevingsloket政府プラットフォームを支えており、市民は環境活動の許可要件を確認する。
中間構造表現は法的テキストからLLMに基づく決定モデルの生成を改善することができるかを検討する。
- 参考スコア(独自算出の注目度): 0.3519650551107762
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Transforming legal text into executable decision logic is a longstanding challenge in legal informatics. With the rise of LLMs, this task has gained renewed interest, but remains challenging due to requiring extensive manual coding and evaluation. We use a unique real-world dataset that pairs production-grade decision models with legal text from the Dutch Environment and Planning Act. These models power the Omgevingsloket government platform, where citizens check permit requirements for environmental activities. We study whether intermediate structured representations can improve LLM-based generation of executable decision models from legal text. We compare four input conditions: raw legal text, text enriched with semantic role labels, text enriched with input and output constraints, and text enriched with both. We evaluate along two dimensions: structural evaluation, through similarity to gold decision models with graph kernels and graphs' descriptive statistics, and outcome evaluation, through functional equivalence by executing models on pre-configured test scenarios. Our findings show that I/O constraints provide the dominant improvement (+37-54% similarity over baseline), while semantic role labels show modest improvements. Outcome evaluation shows that generated models match the gold standard on 51-53% of test scenarios, even though generated models are typically smaller and simpler. We find LLMs eliminate redundant pass-through logic that comprises up to 45-55% of nodes. Importantly, structural similarity and outcome equivalence are complementary: structural similarity does not guarantee outcome equivalence, and vice versa. To facilitate reproducibility, we publicly release our dataset of 95 production decision models with associated legal text and all experimental code.
- Abstract(参考訳): 法的テキストを実行可能な決定論理に変換することは、法的情報学における長年の課題である。
LLMの台頭に伴い、このタスクは新たな関心を集めているが、広範囲な手作業によるコーディングと評価を必要とするため、依然として困難である。
私たちは、オランダ環境計画法(Dutch Environment and Planning Act)の法的テキストとプロダクショングレードの意思決定モデルを組み合わせた、ユニークな実世界のデータセットを使用します。
これらのモデルがOmgevingsloket政府プラットフォームを支えており、市民は環境活動の許可要件を確認する。
中間構造表現は法的テキストからLLMに基づく決定モデルの生成を改善することができるかを検討する。
4つの入力条件を比較する: 原文, 意味的役割ラベルに富んだテキスト, 入力制約と出力制約に富んだテキスト, 両方を豊かにしたテキスト。
グラフカーネルとグラフの記述統計を用いたゴールド決定モデルとの類似性による構造評価と,事前設定されたテストシナリオのモデルの実行による機能的等価性による結果評価の2つの側面に沿って評価する。
以上の結果から,I/O制約はベースラインよりも優位な改善(+37-54%の類似性)を示し,セマンティックロールラベルは控えめな改善が見られた。
アウトカム評価は、生成されたモデルは通常小さく、よりシンプルであるにもかかわらず、51~53%のテストシナリオで生成されたモデルがゴールドスタンダードと一致していることを示している。
LLMは最大45-55%のノードからなる冗長なパススルーロジックを排除している。
重要なことに、構造的類似性と結果の等価性は相補的であり、構造的類似性は結果の等価性を保証しない。
再現性を高めるため、法文と実験コードを含む95の生産決定モデルのデータセットを公開します。
関連論文リスト
- LLMStructBench: Benchmarking Large Language Model Structured Data Extraction [1.338174941551702]
LLM(Large Language Models)の評価のための新しいベンチマークを提案する。
私たちのオープンデータセットは、さまざまな複雑さの多様な手作業による解析シナリオで構成されています。
モデルサイズなどの標準属性よりも適切なプロンプト戦略を選択することが重要であることを示す。
論文 参考訳(メタデータ) (2026-02-16T13:37:58Z) - Modeling the Diachronic Evolution of Legal Norms: An LRMoo-Based, Component-Level, Event-Centric Approach to Legal Knowledge Graphs [0.0]
本稿では,このニーズに対処するため,LRMoo内に構築された時間的モデリングパターンを提案する。
本稿では,このイベント生成アーキテクチャが,特定の日に存在した法文の任意の部分の正確かつ決定論的検索と再構築を可能にする方法を示す。
論文 参考訳(メタデータ) (2025-06-09T15:18:36Z) - An Ontology-Driven Graph RAG for Legal Norms: A Structural, Temporal, and Deterministic Approach [0.0]
標準、平文検索は、法の階層的、横行的、因果的構造に盲目である。
本稿では,法則の形式構造とダイアクロニックな性質を明示的にモデル化することにより,これらの制約を克服するためのオントロジー駆動型フレームワークSAT-Graph RAGを紹介する。
論文 参考訳(メタデータ) (2025-04-29T18:36:57Z) - Attribution analysis of legal language as used by LLM [0.0]
公開可能な2つの法的データセット、より単純な二項分類タスク、および保持者の司法判断を特定するためのより精巧な複数の選択タスクを使用します。
すべてのモデルがケースホールドタスクからテスト例を正しく分類しているのに対して、他の例は1つ、モデル、属性のみによってのみ識別できる。
論文 参考訳(メタデータ) (2025-01-28T22:48:29Z) - CLOMO: Counterfactual Logical Modification with Large Language Models [109.60793869938534]
本稿では,新しいタスク,CLOMO(Counterfactual Logical Modification)と高品質な人間アノテーションベンチマークを紹介する。
このタスクでは、LLMは所定の論理的関係を維持するために、与えられた議論的テキストを順応的に変更しなければなりません。
LLMの自然言語出力を直接評価する革新的な評価指標である自己評価スコア(SES)を提案する。
論文 参考訳(メタデータ) (2023-11-29T08:29:54Z) - Generative Judge for Evaluating Alignment [84.09815387884753]
本稿では,これらの課題に対処するために,13Bパラメータを持つ生成判断器Auto-Jを提案する。
我々のモデルは,大規模な実環境シナリオ下でのユーザクエリとLLM生成応答に基づいて訓練されている。
実験的に、Auto-Jはオープンソースモデルとクローズドソースモデルの両方を含む、強力なライバルのシリーズを上回っている。
論文 参考訳(メタデータ) (2023-10-09T07:27:15Z) - Large Language Models are Diverse Role-Players for Summarization
Evaluation [82.31575622685902]
文書要約の品質は、文法や正しさといった客観的な基準と、情報性、簡潔さ、魅力といった主観的な基準で人間の注釈者によって評価することができる。
BLUE/ROUGEのような自動評価手法のほとんどは、上記の次元を適切に捉えることができないかもしれない。
目的と主観の両面から生成されたテキストと参照テキストを比較し,総合的な評価フレームワークを提供するLLMに基づく新しい評価フレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-27T10:40:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。