論文の概要: BLAD: A Historically Contextualized, Multilingual Dataset of Bangladeshi Legal Acts (1799 to 2025)
- arxiv url: http://arxiv.org/abs/2607.17111v1
- Date: Sun, 19 Jul 2026 07:41:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.375272
- Title: BLAD: A Historically Contextualized, Multilingual Dataset of Bangladeshi Legal Acts (1799 to 2025)
- Title(参考訳): BLAD:バングラデシュの法律法の歴史的に文脈化された多言語データセット(1799年-2025年)
- Abstract要約: バングラデシュ立法法のデータセットは、1799年から2025年の間に制定された1,484の立法機関の収集である。
コーパスは英語、ベンガル語、混成言語の文書にまたがり、法律法の時間的および多言語的分析をサポートする。
CCBY-SA4.0ライセンスでhttps://www.kaggle.com/datasets/sakhadib/bangladesh-legal-acts-datasetで公開されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We present the Bangladesh Legal Acts Dataset (BLAD), a curated collection of 1{,}484 legislative acts enacted between 1799 and 2025. Each act is represented with its full text, structured sections and footnotes, repeal status, and metadata linking it to the governing regime, head of state, and prevailing legal framework at the time of enactment. The corpus spans English, Bengali, and mixed-language documents, supporting temporal and multilingual analysis of statutory law. BLAD addresses a persistent gap in legal natural language processing (NLP) resources for low-resource, civil-law jurisdictions in South Asia. We describe the acquisition and enrichment pipeline, report descriptive statistics over more than two centuries of legislation, and outline the research directions the corpus enables. The dataset is publicly available under the CC~BY-SA~4.0 license at https://www.kaggle.com/datasets/sakhadib/bangladesh-legal-acts-dataset.
- Abstract(参考訳): 我々は、1799年から2025年の間に制定された1{,}484の立法機関であるバングラデシュ法典データセット(BLAD)を提示する。
各行為は、その全文、構造化されたセクションと脚注、廃止されたステータス、およびそれを統治体制、国家元首、制定時の一般的な法的枠組みにリンクするメタデータで表現される。
コーパスは英語、ベンガル語、混成言語の文書にまたがり、法律法の時間的および多言語的分析をサポートする。
BLADは、南アジアにおける低資源で民法的な管轄権のための法律自然言語処理(NLP)資源の永続的なギャップに対処している。
本稿では,買収・濃縮パイプラインについて述べるとともに,2世紀以上の法律に関する記述統計を報告し,コーパスが得る研究の方向性について概説する。
データセットは CC~BY-SA~4.0 License at https://www.kaggle.com/datasets/sakhadib/bangladesh-legal-acts-dataset で公開されている。
関連論文リスト
- PROSLEX: A Novel Dataset for Expert-Annotated Legal Statute Prediction for Indian Judiciary [7.985120216055807]
インドにおける専門家による1,623の法的文書からなる包括的データセット PROSLEX について述べる。
我々は,ゼロショット,少数ショット,チェーン・オブ・シント,およびツリー・オブ・シントなど,様々なプロンプト戦略を評価し,法定予測とそれに対応する法的根拠の両方を生成する。
評価フレームワークは, 性能だけでなく, 生成した説明の一貫性と法的な妥当性も測定し, PROSLEX を説明可能なAIシステム開発のためのベンチマークとして位置づける。
論文 参考訳(メタデータ) (2026-08-09T17:24:09Z) - APPSI-139: A Parallel Corpus of English Application Privacy Policy Summarization and Interpretation [58.55537543016359]
APPSI-139は、ドメインの専門家によって慎重に注釈付けされた、高品質なイギリスのプライバシーポリシーコーパスである。
本稿では,ハイブリッドプライバシポリシ要約・解釈フレームワークTCSI-pp-V2を提案する。
論文 参考訳(メタデータ) (2026-04-30T07:58:24Z) - WisdomInterrogatory (LuWen): An Open-Source Legal Large Language Model Technical Report [55.27414605169639]
Wesdom Interrogatory (LuWen)は,バイチュン基礎モデルに基づいて構築された,オープンソースの中国語の法律モデルである。
予測と生成の両方にまたがる5つの代表的な法的課題についてLuWenを評価する。
論文 参考訳(メタデータ) (2026-04-08T06:59:07Z) - TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild [102.11425887660327]
音声技術は急速に進歩し、世界中の多様な人口に役立っている。
多くの言語は限られた資源のために表現されていない。
台湾の台義における実世界の発話意図データセットであるtextbfTaigiSpeechを紹介した。
論文 参考訳(メタデータ) (2026-03-23T01:44:45Z) - SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts [0.0]
SinhaLegalは1,206件の法的文書に約200万語を含むSinhala法定テキストコーパスを導入している。
データセットには、1981年から2014年までの1,065件、2010年から2014年までの141件の法律文書が含まれている。
テキストは、Google Document AIでOCRを使用して抽出され、続いて広範な後処理と手作業によるクリーニングにより、高品質でマシン可読なコンテンツが保証された。
論文 参考訳(メタデータ) (2026-03-05T06:13:44Z) - Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy [0.0]
我々はスリランカの議会手続、法的判断、政府出版物、ニュース、観光統計を網羅したオープンで機械可読な文書データセットを提示する。
このコレクションは、シンハラ、タミル、英語の24のデータセットにまたがる230,091の文書(57.7GB)で構成されている。
これらの資源は、計算言語学、法的分析、社会政治学、多言語自然言語処理の研究を支援することを目的としている。
論文 参考訳(メタデータ) (2025-10-05T09:57:40Z) - InternLM-Law: An Open Source Chinese Legal Large Language Model [72.2589401309848]
InternLM-Lawは、中国法に関する様々な法的クエリに対処するための特殊なLLMである。
われわれは、中国法域に100万以上のクエリを含むデータセットを慎重に構築する。
InternLM-LawはLawBench上で最高の平均性能を達成し、20サブタスク中13サブタスクでGPT-4を含む最先端モデルを上回っている。
論文 参考訳(メタデータ) (2024-06-21T06:19:03Z) - A Multi-Task Benchmark for Korean Legal Language Understanding and
Judgement Prediction [19.89425856249463]
韓国の法律AIデータセットであるLBox Openの大規模なベンチマークについて紹介する。
この法定コーパスは150万の韓国の先例(2億6400万トークン)で構成され、そのうち過去4年間に63万の判決が下された。
2つの分類課題は事例名(10k)と個々の事例の事実記述による法令(3k)の予測である。
LJP タスクは,(1) 1k 件の犯罪事例からなり,そのモデルに詳細な量の予測,労働への投獄,及び与えられた事実に対する労働範囲のない投獄が求められる。
論文 参考訳(メタデータ) (2022-06-10T16:51:45Z) - A Statutory Article Retrieval Dataset in French [4.082216579462797]
ベルギー法令検索データセット(BSARD)について紹介する。
BSARDは、経験豊富な法学者によってラベル付けされた1,100以上のフランス原住民の法的問題と、22,600以上のベルギー法記事のコーパスから関連する記事で構成されている。
項重み付けとプール埋め込みに基づく教師なし情報検索手法のベンチマークを行った。
私たちの最高のパフォーマンスベースラインは50.8%のR@100を達成しています。
論文 参考訳(メタデータ) (2021-08-26T13:50:20Z) - Lawformer: A Pre-trained Language Model for Chinese Legal Long Documents [56.40163943394202]
我々は,中国法定長文理解のためのLongformerベースの事前学習言語モデル,Lawformerをリリースする。
判決の予測,類似事例の検索,法的読解,法的質問の回答など,さまざまな法務上の課題について法務担当者を評価した。
論文 参考訳(メタデータ) (2021-05-09T09:39:25Z) - \textit{StateCensusLaws.org}: A Web Application for Consuming and
Annotating Legal Discourse Learning [89.77347919191774]
法律テキストの対話セグメントを解析およびラベル付けするために訓練されたNLPモデルの出力を強調表示するためのWebアプリケーションを作成します。
我々は、米国国勢調査人口を用いて資源を割り当て、政府を組織する州レベルの法律に焦点を当てる。
論文 参考訳(メタデータ) (2021-04-20T22:00:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。