論文の概要: Nepali Legal Expertise through Generative and Extractive Pre-trained Transformers (NepLEGiT)
- arxiv url: http://arxiv.org/abs/2609.16010v1
- Date: Sat, 08 Aug 2026 09:54:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.533469
- Title: Nepali Legal Expertise through Generative and Extractive Pre-trained Transformers (NepLEGiT)
- Title(参考訳): NepLEGiT(NepLEGiT)によるネパールの法律専門家の育成
- Abstract要約: 我々は、特殊小言語モデル(SLM)であるNepLEGiT(Nepali Legal Expertise through Generative and Extractive Pre-trained Transformers)を提案する。
我々はネパールの法文の400万トークンのキュレートされたコーパスを用いて、デコーダベースのGPT-2 SLMをスクラッチから事前訓練する。
NepLEGiTは0.5684のクロスエントロピー損失、1.8のパープレキシティ、82.9%の次点予測精度を達成している。
- 参考スコア(独自算出の注目度): 0.8363778331230401
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: The complexity of legal language and limited accessibility to legal information pose significant challenges to justice delivery in Nepal. Traditional legal services remain inaccessible to many citizens due to language barriers, information fragmentation, and a critical shortage of legal expertise, particularly in rural areas. We present NepLEGiT (Nepali Legal Expertise through Generative and Extractive Pre-trained Transformers), a specialized small language model (SLM) designed to democratize legal knowledge and enhance legal-service delivery in Nepal. We pre-train a decoder-based GPT-2 SLM from scratch on a curated corpus of ~4 million tokens of Nepali legal text, covering constitutional law, civil and criminal codes, and administrative regulations. The model comprises ~30 million parameters in a 6-layer, 6-head, 384-dimensional transformer trained with warmup cosine-decay scheduling, gradient accumulation, and mixed-precision arithmetic. On a held-out validation split, NepLEGiT attains a cross-entropy loss of 0.5684, a perplexity of 1.8, and a next-token prediction accuracy of 82.9%. We further evaluate continual masked-language-model pre-training of mBERT and MuRIL on the same corpus; mBERT achieves a perplexity of 2.35 (eval loss 0.8565), outperforming MuRIL (perplexity 6.07, eval loss 1.8026), providing a strong encoder baseline complementary to NepLEGiT's generative orientation.
- Abstract(参考訳): 法的な言語の複雑さと法的な情報へのアクセシビリティの制限は、ネパールにおける司法提供に大きな課題をもたらしている。
伝統的な法的サービスは、言語障壁、情報の断片化、および特に農村部における法的な専門知識の欠如により、多くの市民にアクセスできないままである。
我々は,ネパールにおける法律知識の民主化と法的サービス提供の促進を目的とした,特殊小言語モデル(SLM)であるNepLEGiT(Nepali Legal Expertise through Generative and Extractive Pre-trained Transformers)を紹介する。
我々は、ネパール法典の約400万トークンのキュレートされたコーパスに基づいて、デコーダベースのGPT-2 SLMをスクラッチから事前訓練し、憲法法、民法及び刑事法典、行政規則を規定する。
このモデルは、6層、6ヘッド、384次元トランスフォーマーで約3000万のパラメータで構成され、ウォームアップコサイン・デカイスケジューリング、勾配累積、混合精度演算を訓練している。
ホールドアウト検証分割では、NepLEGiTは0.5684のクロスエントロピー損失、1.8のパープレキシティ、82.9%の次点予測精度を達成している。
mBERTは2.35(eval loss 0.8565), MuRIL(perplexity 6.07, eval loss 1.8026, perplexity 6.07, eval loss 1.8026)より優れ, NepLEGiTの生成方向を補完する強力なエンコーダベースラインを提供する。
関連論文リスト
- NITP: Next Implicit Token Prediction for LLM Pre-training [62.744626632562664]
本研究では,表現空間に直接集中的監督を施した離散予測を増大させるために,Next Implicit Token Prediction (NITP)を提案する。
NITPは、安定な自己教師対象と同じモデルから浅層表現を用いて、次のトークンの暗黙的なセマンティック内容を予測するようにモデルを訓練する。
実験的には、0.5Bから9Bのパラメータを含む高密度モデルとMoEモデルにまたがって、NITPは無視できる計算オーバーヘッドでダウンストリーム性能を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-24T09:13:12Z) - Automatic Construction of a Legal Citation Graph from 100 Million Ukrainian Court Decisions: Large-Scale Extraction, Topological Analysis, and Ontology-Driven Clustering [0.0]
ウクライナの裁判所決定から抽出された1070万件の訴訟の端は、司法の引用構造が監督なしで法域の境界をコードしていることを示している。
完全SRレジストリから最初の大規模引用グラフ(9950万全文、1.1TB)を構築する。
論文 参考訳(メタデータ) (2026-05-14T19:42:20Z) - WisdomInterrogatory (LuWen): An Open-Source Legal Large Language Model Technical Report [55.27414605169639]
Wesdom Interrogatory (LuWen)は,バイチュン基礎モデルに基づいて構築された,オープンソースの中国語の法律モデルである。
予測と生成の両方にまたがる5つの代表的な法的課題についてLuWenを評価する。
論文 参考訳(メタデータ) (2026-04-08T06:59:07Z) - LegalOne: A Family of Foundation Models for Reliable Legal Reasoning [54.57434222018289]
我々は、中国の法律ドメインに特化された基礎モデルのファミリーであるLegalOneを紹介します。
LegalOneは、法的推論をマスターするために設計された包括的な3フェーズパイプラインを通じて開発されている。
LegalOneの重み付けとLegalKit評価フレームワークを公開して、Legal AIの分野を前進させます。
論文 参考訳(メタデータ) (2026-01-31T10:18:32Z) - Towards Nepali-language LLMs: Efficient GPT training with a Nepali BPE tokenizer [0.0]
本研究は、GPT-3にインスパイアされた複数のトレーニング戦略を用いて訓練された、GPT-2に基づくネパール語モデルを提案する。
このモデルは3.168177のトレーニング損失、3.08 1982の検証損失、21.80の最終的な難しさを達成し、一貫性のあるネパールのニューススタイルのテキストを生成する能力を示した。
論文 参考訳(メタデータ) (2025-12-16T16:53:11Z) - ClaimGen-CN: A Large-scale Chinese Dataset for Legal Claim Generation [56.79698529022327]
法的な主張は、事件における原告の要求を言及し、法的理由づけと事件解決を導くのに不可欠である。
本稿では,その事例の事実に基づく法的クレーム生成の問題について考察する。
われわれは,中国法定クレーム生成タスクの最初のデータセットであるClaymGen-CNを構築した。
論文 参考訳(メタデータ) (2025-08-24T07:19:25Z) - LexPro-1.0 Technical Report [19.83460019437367]
高度に専門化された中国の法律ドメイン用に設計された大規模言語モデルであるLexPro-1.0について紹介する。
これを解決するために、まず中国31州から20種類以上の犯罪を対象とする数百万件の法的文書を収集し、モデルトレーニングを行った。
このモデルは、さらなる監督なしに大規模な強化学習を行い、推論能力と説明可能性の向上を強調している。
論文 参考訳(メタデータ) (2025-03-10T05:54:23Z) - PARAMANU-AYN: Pretrain from scratch or Continual Pretraining of LLMs for Legal Domain Adaptation? [3.9018931027384056]
パラマヌ・アイン(Paramanu-Ayn)は、インドの訴訟文書に特化して訓練された法律言語モデルのコレクションである。
Paramanu-Aynは1つのGPU上でわずか185時間、コンテキストサイズ8192のスクラッチから事前トレーニングされた。
論文 参考訳(メタデータ) (2024-03-20T15:39:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。