論文の概要: GreenLeaf Law Embed Tiny: A Compact Embedding Model for Legal Domain Retrieval
- arxiv url: http://arxiv.org/abs/2608.24936v1
- Date: Sun, 23 Aug 2026 23:24:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.264197
- Title: GreenLeaf Law Embed Tiny: A Compact Embedding Model for Legal Domain Retrieval
- Title(参考訳): GreenLeaf Law Embed Tiny: 法律ドメイン検索のためのコンパクトな埋め込みモデル
- Abstract要約: GreenLeaf-TinyがMLEB(Massive Legal Embedding Benchmark)で75.11%、MTEB(Law, v1)で64.38%を獲得
この結果から,高品質なデータを用いたドメイン固有トレーニングにより,特定のドメインアプリケーションの性能が向上することが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present GreenLeaf Law Embed Tiny, a 0.6B parameter embedding model for legal domain retrieval. GreenLeaf-Tiny achieves 75.11% on the Massive Legal Embedding Benchmark (MLEB) and 64.38% on MTEB(Law, v1),demonstrating competitive performance among models under 1B parameters. Our approach combines a two-stage training pipeline that first distills knowledge from a larger teacher model into a compact student architecture, then applies domain-specific fine-tuning with hard negative mining; a carefully curated dataset of 3.4 million query-passage pairs, including 150,000 human-curated samples across diverse legal jurisdictions; and an efficient inference architecture supporting multiple quantization levels (BF16, INT8, binary) enabling deployment in resource-constrained environments. We provide detailed analysis of our training methodology, architectural choices, and comprehensive evaluation across legal retrieval tasks. Our results demonstrate that domain-specific training with high-quality data can improve performance for specialized domain applications
- Abstract(参考訳): 法ドメイン検索のための0.6Bパラメータ埋め込みモデルであるGreenLeaf Law Embed Tinyを提案する。
GreenLeaf-Tinyは、MLEB(Massive Legal Embedding Benchmark)で75.11%、MTEB(Law, v1)で64.38%を獲得し、1Bパラメータ以下のモデル間での競争性能を実証している。
提案手法は,より大規模な教師モデルから,よりコンパクトな学生アーキテクチャへ知識を抽出し,ドメイン固有の微調整と強負のマイニングを施した2段階の訓練パイプラインと,さまざまな司法管轄区域にまたがる15万件の人為的なサンプルを含む340万件のクエリ・パス・ペアを慎重に収集したデータセットと,リソース制約のある環境への展開を可能にする複数の量子化レベル(BF16,INT8,バイナリ)をサポートする効率的な推論アーキテクチャを組み合わせる。
本研究は,法的な検索作業におけるトレーニング方法論,建築的選択,包括的評価について詳細に分析する。
我々の結果は、高品質なデータによるドメイン固有トレーニングが、特定のドメインアプリケーションの性能を向上させることを実証している。
関連論文リスト
- MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale [92.09717763663873]
我々は、データエンジニアリングとトレーニング戦略設計を通じて、純粋に最先端の技術を進化させるMinerU2.5-Proを提案する。
コアとなるのは、カバレッジ、情報性、アノテーションの正確性を中心に設計されたData Engineだ。
我々は,MinerU2.5-Pro が OmniDocBench v1.6 上で 95.69 を達成することを示す。
論文 参考訳(メタデータ) (2026-04-06T15:44:18Z) - PRUE: A Practical Recipe for Field Boundary Segmentation at Scale [50.194423500109025]
本研究では,大域境界線決定のためのセグメント化と地理空間基盤モデル(GFM)を初めて体系的に評価する。
U-Netセマンティックセマンティックセグメンテーションモデルは、パフォーマンスとデプロイメントのメトリクスのスイートにおいて、インスタンスベースとGFMの代替よりも優れています。
我々のアプローチは、モデル設計、トレーニング、推論にまたがる、信頼性があり、スケーラブルで再現可能なフィールド境界記述のための実践的なフレームワークを提供します。
論文 参考訳(メタデータ) (2026-03-28T02:47:46Z) - Can Small Models Reason About Legal Documents? A Comparative Study [0.0]
大規模言語モデルは法的なアプリケーションには有望であるが、フロンティアモデルのデプロイは、コスト、レイテンシ、データプライバシに関する懸念を提起する。
3つの法的なベンチマークで9つのモデルをテストすることにより,サブ10Bパラメータモデルが実用的な代替手段として機能するかどうかを評価する。
論文 参考訳(メタデータ) (2026-03-26T22:28:20Z) - Mecellem Models: Turkish Models Trained from Scratch and Continually Pre-trained for the Legal Domain [0.0]
本稿では,トルコの法律ドメインのための専門言語モデルを開発するためのフレームワークであるMecellemモデルを提案する。
Scratchから事前訓練されたエンコーダモデル:ModernBERTベースの双方向エンコーダをトルコ支配の112億トークンのコーパスで事前訓練し、(2)継続事前トレーニング(CPT)によるデコーダモデル:Qwen3-1.7BとQwen3-4Bをトルコの法域に適応させた。
論文 参考訳(メタデータ) (2026-01-22T14:41:32Z) - MortgageLLM: Domain-Adaptive Pretraining with Residual Instruction Transfer, Alignment Tuning, and Task-Specific Routing [0.7367330074083941]
ドメイン固有の新しい大規模言語モデルであるMortgageLLMを提案する。
シングルベースモデルからデュアルトラックの特殊化フレームワークを用いて開発されている。
我々は,(1)高度に専門化された住宅ローン金融分野へのこの残留手法の適用,(2)対話型Q&Aモデルと,分類と要約のための構造化タスクモデルを組み合わせたデュアルエキスパートアーキテクチャ,(3)エキスパートモデル自体が行う少数ショット分類を用いたインテリジェントタスクルーティング機構を提案する。
論文 参考訳(メタデータ) (2025-11-26T06:37:57Z) - Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models [49.911784762244814]
TraceRLは拡散言語モデル(DLM)のための軌道対応強化学習フレームワークである
我々は最先端の拡散言語モデル、すなわち TraDo を導出する。
TraDo-8B-InstructはQwen2.5-7B-Instructで6.1%、Llama3.1-8B-Instructで51.3%の精度向上を実現している。
論文 参考訳(メタデータ) (2025-09-08T17:58:06Z) - Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains [92.36624674516553]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデル(LLM)の数学的推論と符号化性能の向上に成功している。
本稿では,医学,化学,心理学,経済学,教育など,さまざまな現実世界領域におけるRLVRの有効性と拡張性について検討する。
我々は,2値検証による制限を克服するために,ソフトなモデルに基づく報酬信号を生成する生成的スコアリング手法を利用する。
論文 参考訳(メタデータ) (2025-03-31T08:22:49Z) - MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale [66.73529246309033]
MLLM(Multimodal large language model)は、多モーダルタスクにおいて大きな可能性を秘めている。
既存の命令チューニングデータセットは、中間的合理性のないフレーズレベルの答えのみを提供する。
そこで本研究では,大規模マルチモーダル・インストラクション・チューニング・データセットを構築するためのスケーラブルで費用対効果の高い手法を提案する。
論文 参考訳(メタデータ) (2024-12-06T18:14:24Z) - Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training [73.90260246781435]
私たちは、このようなアーキテクチャを自動回帰言語モデルに拡張する最初のアプローチであるLoryを紹介します。
パラメータマッチングされた高密度モデルよりも、多種多様な下流タスクにおいて顕著な性能向上を示す。
セグメントレベルのルーティングにもかかわらず、Loryモデルはトークンレベルのルーティングを備えた最先端のMoEモデルと比較して、競合的なパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-05-06T03:06:33Z) - PARAMANU-AYN: Pretrain from scratch or Continual Pretraining of LLMs for Legal Domain Adaptation? [3.9018931027384056]
パラマヌ・アイン(Paramanu-Ayn)は、インドの訴訟文書に特化して訓練された法律言語モデルのコレクションである。
Paramanu-Aynは1つのGPU上でわずか185時間、コンテキストサイズ8192のスクラッチから事前トレーニングされた。
論文 参考訳(メタデータ) (2024-03-20T15:39:54Z) - When Does Pretraining Help? Assessing Self-Supervised Learning for Law
and the CaseHOLD Dataset [2.0924876102146714]
53,000以上の選択質問からなる新しいデータセットを提示し、引用されたケースの保持状況を特定する。
タスクがプリトレーニングコーパスと十分な類似性を示すと、ドメイン事前トレーニングが保証される可能性がある。
我々の研究結果は、研究者がいつリソース集約的な事前訓練を行うべきかを知らせ、Transformerベースのアーキテクチャも、異なる法的言語を示唆する埋め込みを学習することを示す。
論文 参考訳(メタデータ) (2021-04-18T00:57:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。