論文の概要: Bundesrecht: An Open Library and Corpus for German Statutory Reference Processing
- arxiv url: http://arxiv.org/abs/2605.31338v1
- Date: Fri, 29 May 2026 14:18:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.657526
- Title: Bundesrecht: An Open Library and Corpus for German Statutory Reference Processing
- Title(参考訳): Bundesrecht: ドイツの法令参照処理のためのオープンライブラリとコーパス
- Abstract要約: Bundesrechtはドイツの法定参照処理のためのオープンリソースである。
ソフトウェアライブラリと、ドイツ連邦法の構造化コーパスで構成されている。
図書館は、ドイツの法典参照を解析し、正規化し、解決する。
- 参考スコア(独自算出の注目度): 16.021243861778846
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Statutory references are central to legal language understanding, but are difficult to process automatically, as they appear in compact and variable surface forms, may combine multiple targets, use special abbreviations, and often point to lower-level units. Existing tools for German focus either on parsing references from legal documents or accessing statutory text once citations are explicit. This paper introduces bundesrecht, an open resource for German statutory reference processing, consisting of a software library and a structured corpus of German federal law. The library parses, normalizes, and resolves German statutory references, mapping raw citation strings to structured objects, expanding compact references into canonical forms, and linking them to statutory provisions. The accompanying dataset preserves the internal hierarchy of statutes from laws to fine-granular subclauses. We evaluate the parser and normalizer on 2,944 annotated German legal references using strict exact-match and micro information extraction metrics. We further evaluate canonical reference deduplication and show that normalized references group real citation surface variants far more reliably than string matching. bundesrecht is the first open resource that covers German statutory reference processing as an end-to-end pipeline, from raw citation string to resolved statutory provision, and is available on PyPI.
- Abstract(参考訳): 法定参照は法的言語理解の中心であるが、コンパクトで可変な表面形に現れるため、自動的に処理することは困難であり、複数のターゲットを結合し、特別な略語を使用し、しばしば下位レベルの単位を指し示す。
既存のドイツのツールでは、法律文書からの参照を解析したり、引用が明確になったら法定テキストにアクセスしたりすることに焦点を当てている。
本稿では,ドイツ連邦法のソフトウェアライブラリと構造化コーパスからなる,ドイツの法令参照処理のためのオープンリソースである Bundesrecht を紹介する。
図書館はドイツの法定参照を解析し、正規化し、解決し、生の引用文字列を構造化対象にマッピングし、コンパクトな参照を標準形式に拡張し、それらを法定条項にリンクする。
付随するデータセットは、法令の内部階層を法則から細粒状部分宣言まで保存する。
我々は, 厳密な精度マッチングとマイクロ情報抽出指標を用いて, 2,944 のアノテート法則に対するパーザと正規化器の評価を行った。
さらに,正規化参照は文字列マッチングよりもはるかに信頼性の高い実引用曲面の変種であることを示す。
Bundesrechtは、生の引用文字列から解決された法定条項まで、ドイツの法定参照処理をエンドツーエンドパイプラインとしてカバーする最初のオープンリソースであり、PyPIで利用可能である。
関連論文リスト
- ANNOTARES: A Dataset for Extracting Logical Structures from German Statutory Texts [4.897636783430679]
本稿では,ドイツ法典に法的条件 (Tatbestand) と法的結果 (Rechtsfolge) を識別・分節する作業を紹介する。
この課題を支援するために,ドイツ法文とスパンレベルアノテーションを組み合わせた新しいデータセットAnnoTARESを提案する。
論文 参考訳(メタデータ) (2026-08-04T16:28:53Z) - Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering [54.97384993676565]
複雑な国内R&D規制から派生した運用知識グラフを特徴とする,新たなベンチマークであるRegOps-Benchを用いて,レギュレーションコンプライアンスQAを形式化する。
RefWalkはクロスドキュメントの引用を横切り、マックスベースのアグリゲーションを通じてマルチビュー候補を融合させ、ソースへのクレームを明示的にマッピングするためにルールごとの属性を強制する。
論文 参考訳(メタデータ) (2026-05-28T10:38:38Z) - LEMUR: A Corpus for Robust Fine-Tuning of Multilingual Law Embedding Models for Retrieval [18.46710400838861]
大規模言語モデル(LLM)は、法律情報へのアクセスにますます利用されている。
しかし、その多言語法的設定への展開は、信頼性の低い検索と、ドメイン適応型、オープンな埋め込みモデルの欠如によって制限されている。
LEMURは、EUの環境法律の大規模多言語コーパスであり、24,953のEUR-Lex PDF文書から25の言語をカバーする。
論文 参考訳(メタデータ) (2026-02-10T09:20:24Z) - Poly-Vector Retrieval: Reference and Content Embeddings for Legal Documents [0.0]
法的文脈では、ユーザーは自分のコンテンツではなく、ラベルやあだ名によってしばしばノルムを参照する。
本稿では,各法則に複数の異なる埋め込みを割り当てるポリレトリヴァルについて述べる。
ラベル中心のクエリの検索精度を大幅に向上し、内部および外部の参照を解決できる。
論文 参考訳(メタデータ) (2025-04-09T17:54:11Z) - LexMatcher: Dictionary-centric Data Collection for LLM-based Machine Translation [67.24113079928668]
本稿では、バイリンガル辞書に見られる感覚のカバレッジによって駆動されるデータキュレーション手法であるLexMatcherを提案する。
我々の手法は、WMT2022テストセットの確立されたベースラインよりも優れています。
論文 参考訳(メタデータ) (2024-06-03T15:30:36Z) - A New Aligned Simple German Corpus [2.7981463795578927]
単純ドイツ語のための文列単言語コーパスを新たに提案する。
自動文アライメント手法を用いてアライメントした複数の文書アライメントソースを含んでいる。
文のアライメントの質は、F1スコアで測定されたように、以前の作業を上回る。
論文 参考訳(メタデータ) (2022-09-02T15:14:04Z) - Hierarchical Context Tagging for Utterance Rewriting [51.251400047377324]
配列を線形に生成するのではなくタグ付けする方法は、ドメイン内および外部の書き直し設定においてより強力であることが証明されている。
本稿では,スロット付きルールを予測してこの問題を緩和する階層型コンテキストタグを提案する。
いくつかのベンチマーク実験により、HCTは2つのBLEUポイントで最先端の書き換えシステムより優れていることが示された。
論文 参考訳(メタデータ) (2022-06-22T17:09:34Z) - UnifieR: A Unified Retriever for Large-Scale Retrieval [84.61239936314597]
大規模な検索は、クエリを与えられた巨大なコレクションから関連ドキュメントをリコールすることである。
事前学習型言語モデル(PLM)に基づく最近の検索手法は,高密度ベクターあるいはレキシコンに基づくパラダイムに大別することができる。
本論文では,高密度ベクトルとレキシコンに基づく検索を2つの表現能力を持つ1つのモデルで統合する学習フレームワークUnifieRを提案する。
論文 参考訳(メタデータ) (2022-05-23T11:01:59Z) - \textit{StateCensusLaws.org}: A Web Application for Consuming and
Annotating Legal Discourse Learning [89.77347919191774]
法律テキストの対話セグメントを解析およびラベル付けするために訓練されたNLPモデルの出力を強調表示するためのWebアプリケーションを作成します。
我々は、米国国勢調査人口を用いて資源を割り当て、政府を組織する州レベルの法律に焦点を当てる。
論文 参考訳(メタデータ) (2021-04-20T22:00:54Z) - Automatic Extraction of Rules Governing Morphological Agreement [103.78033184221373]
原文から第一パス文法仕様を抽出する自動フレームワークを開発する。
我々は、世界の多くの言語の文法の中核にあるモルフォシンタクティックな現象である合意を記述する規則の抽出に焦点をあてる。
我々のフレームワークはUniversal Dependenciesプロジェクトに含まれるすべての言語に適用され、有望な結果が得られます。
論文 参考訳(メタデータ) (2020-10-02T18:31:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。