論文の概要: Do Small Models Use the Law You Give Them? Context-Injected Fine-Tuning for Legal QA in Bangladesh
- arxiv url: http://arxiv.org/abs/2607.23446v1
- Date: Sun, 26 Jul 2026 04:06:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.104415
- Title: Do Small Models Use the Law You Give Them? Context-Injected Fine-Tuning for Legal QA in Bangladesh
- Title(参考訳): バングラデシュの法則は小さなモデルでも使えるか? バングラデシュの法定QAにコンテキストインジェクトによる微調整
- Abstract要約: 小さな言語モデルは、規制法の規定を受け取り、いまだに誤った回答をすることができる。
関連する法則を含む事例の微調整が、後続の法則の使用を改善するかどうかを検証した。
評価はバングラデシュの2022年と2023年のバーカウンシル試験と機械翻訳英語を用いている。
- 参考スコア(独自算出の注目度): 2.062723244880136
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A small language model can receive the governing statutory provision and still answer incorrectly. We test whether fine-tuning on examples containing relevant law improves later use of retrieved law. We curate 2{,}165 bilingual QA records from six Bangladeshi acts and three schedules, then fine-tune Qwen3.5 at 0.8B, 2B, and 4B. Evaluation uses the 2022 and 2023 Bangladesh Bar Council exams in Bangla and machine-translated English, with no retrieval, BM25, or FAISS, scored by strict consistency over three seeded runs. At 0.8B, fine-tuning raises the 2022 English FAISS score from 2 to 34 of 100. Gains at 0.8B and 2B survive paired testing, but the 4B model has no detectable net gain: Bangla improves while several English conditions regress. Fine-tuning also reduces answers that drift from Bangla into mostly English from 44.0--53.2\% to 0.2--0.7\%, with adjusted $p<.001$ at every scale. Retrieval quality is therefore not the only bottleneck. Small bilingual legal models also differ in how they use supplied law and whether they answer in the requested language. The dataset is publicly available at https://huggingface.co/datasets/momahadi/bangladesh-legal-qa-dataset.
- Abstract(参考訳): 小さな言語モデルは、規制法の規定を受け取り、いまだに誤った回答をすることができる。
関連する法則を含む事例の微調整が、後続の法則の使用を改善するかどうかを検証した。
バングラデシュの6つの行為と3つのスケジュールから2{,}165のバイリンガルQAレコードをキュレートし,0.8B,2B,4BでQwen3.5を微調整した。
2022年と2023年のバングラデシュのバー・カウンシル試験(英語版)と機械翻訳英語(英語版)を使用し、3回のシードランに対して厳格な厳格な厳格さで、検索、BM25、FAISSは行われていない。
0.8Bでは、2022年のFAISSのスコアを100点中2点から34点に引き上げている。
0.8Bと2Bのゲインはペアテストで生存するが、4Bモデルは検出可能な純ゲインを持たない。
微調整により、バングラからほとんど英語に流れ込む答えは44.0--53.2\%から0.2--0.7\%に減少し、全てのスケールで調整された$p<.001$となる。
したがって、検索品質だけがボトルネックではない。
小さなバイリンガル法モデルもまた、供給された法律の使い方と、要求された言語で答えるかどうかが異なる。
データセットはhttps://huggingface.co/datasets/momahadi/bangladesh-legal-qa-datasetで公開されている。
関連論文リスト
- Do Small Models Use the Law You Give Them? Measuring Context Use on a Bilingual Bangladesh Legal Benchmark [2.062723244880136]
微調整は、文脈で供給される法律の使用方法を改善することなく、法的質問応答精度を向上させることができる。
我々は,階層保存法定コーパス,2,165個のバイリンガル微調整例,150項目の供給法則制御を構築した。
論文 参考訳(メタデータ) (2026-08-31T06:45:16Z) - Quantization Effects on Bangla Language Understanding in Large Language Models: A Systematic Evaluation [0.0]
トレーニング後の量子化は、Large Language Models(LLM)のメモリフットプリントを低くし、推論を高速化する。
バングラ語のような形態学的に複雑な低リソース言語についても、同じことが当てはまるかどうかは定かではない。
Qwen-2.5-7B, LLaMA-3.1-8B, GPT-OSS-20Bの3つのモデルファミリを完全精度と3種類の量子化形式で評価した。
論文 参考訳(メタデータ) (2026-08-25T14:36:09Z) - LKValues: Aligning Large Language Models with Sri Lankan Societal Values [41.84116838445288]
既存のベンチマークは、公式言語であるSinhalaのSri Lankanのコンテクスト化値を見落としている。
Sri Lankan値アライメントのための最初のサーベイグラウンドのリソーススイートであるLKValuesを提案する。
論文 参考訳(メタデータ) (2026-07-22T17:49:37Z) - GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models [0.06157382820537719]
大規模言語モデル(LLM)における数学的推論の評価は、主に英語のような高リソース言語に焦点を当てている。
本研究は,ベンガルの新たな摂動型数学的データセットであるGSM-Plus-BNを紹介する。
我々は、9000個の評価サンプルのベンチマークを用いて、6つのオープンソースのLCM Qwen3-32B, Llama-3.1-8B-Instant, Llama-3.3-70B-Versatile, Llama-4-Scout-17B-16E-Instruct, GPT-OSS-120B, GPT-OSS-20Bを評価した。
論文 参考訳(メタデータ) (2026-07-14T20:23:27Z) - A Sovereign, Open-Source Foundation Model for German and English [50.08096276509294]
Soofi S 30B-A3B(ソフィー S 30B-A3B)は、ドイツのマムバ・トランスフォーマー・ファウンデーション・モデルである。
そのハイブリッド設計はトークン毎に30Bパラメータの3Bのみを起動し、コンテキストが大きくなるにつれて推論キャッシュをほぼ一定に保ちます。
論文 参考訳(メタデータ) (2026-07-10T13:51:41Z) - ImmigrationQA: A Source-Grounded Dataset and Small-Model Adaptation for U.S. Immigration Law [0.0]
本稿では、17,058対の質問応答データセットであるImmigrationQAの構築について述べる。
コーパスは11の一次および二次のソースから組み立てられた。
微調整モデルを993対の保留分割に対して評価した。
論文 参考訳(メタデータ) (2026-05-28T21:36:18Z) - SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models [0.0]
SomaliBench v0。
4つのモデルすべてに対して、大きな英語とソマリアの拒絶ギャップが見つかる。
3つのモデルにおいて、支配的なソマリアの非拒絶モードは、有害なコンプライアンスに恵まれず、不明確な出力である。
論文 参考訳(メタデータ) (2026-05-25T04:45:44Z) - LegalBench-BR: A Benchmark for Evaluating Large Language Models on Brazilian Legal Decision Classification [0.0]
ブラジルの法律テキスト分類における言語モデル評価のための最初の公開ベンチマークであるLegalBench-BRを紹介する。
データセットは、サンタカタリーナ州裁判所(TJSC)による3,105の手続きからなる。
クラスバランステストセットでは、BERTimbau-LoRAは87.6%の精度と0.87のマクロF1を達成する(Claude 3.5 Haikuより+22pp、GPT-4o miniより+28pp)。
論文 参考訳(メタデータ) (2026-04-20T22:00:02Z) - Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning [74.00326879493225]
textttSP3Fは、ターゲット言語におけるテクティタニーデータなしで多言語推論を強化するフレームワークである。
まず、英語の質問応答対の翻訳版にファインチューン(SFT)を監督し、ベースモデルの正確性を高める。
第二に、RLはペアワイズ・ジャッジからのフィードバックをセルフプレイ方式で実行し、裁判官は英語の参照応答をテキストプライベート情報として受信する。
論文 参考訳(メタデータ) (2026-01-26T17:46:44Z) - Relative Scaling Laws for LLMs [91.73497548097775]
スケーリング法則は、追加のデータ、パラメータ、計算によって言語モデルがどのように改善されるかを記述する。
相対的なスケーリング法則を導入し、テスト分布間のパフォーマンスギャップをスケールで追跡する。
これらの結果は、スケーリングは全体的なパフォーマンスを改善するが、普遍的等化器ではないことを示している。
論文 参考訳(メタデータ) (2025-10-28T16:55:22Z) - Parameter-Efficient Fine-Tuning for Low-Resource Languages: A Comparative Study of LLMs for Bengali Hate Speech Detection [0.0]
本稿では,LoRAとQLoRAを用いたベンガルヘイトスピーチ検出におけるPEFT(Efficient Fine-Tuning)の最初の応用について述べる。
BD-SHSデータセットには50,281の注釈付きコメントが記載されている。
Llama-3.2-3Bは92.23%、Mistral-7Bは88.94%、Gemma-3-4Bは80.25%だった。
論文 参考訳(メタデータ) (2025-10-19T20:03:22Z) - Language models scale reliably with over-training and on downstream tasks [121.69867718185125]
スケーリング法則は、高価なトレーニング実行を引き出すための有用なガイドである。
しかし、現在の研究と言語モデルがどのように訓練されているかには差がある。
対照的に、スケーリング法則は主に推論における損失を予測するが、モデルは通常下流のタスクのパフォーマンスで比較される。
論文 参考訳(メタデータ) (2024-03-13T13:54:00Z) - How Can We Know When Language Models Know? On the Calibration of
Language Models for Question Answering [80.82194311274694]
言語モデルがいつ、自信を持って、特定のクエリに対する答えを知っているか、どのように知ることができるか?
我々は,T5,BART,GPT-2の3つの強力な生成モデルを検討した。
次に、そのようなモデルの校正方法を検討し、その信頼性スコアを正しさの確率と相関させる。
論文 参考訳(メタデータ) (2020-12-02T03:53:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。