論文の概要: RAGAL: A Frugal, Fully Local Retrieval-Augmented Assistant for Technical Support at a Government Agency
- arxiv url: http://arxiv.org/abs/2607.18756v1
- Date: Tue, 21 Jul 2026 06:25:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.33579
- Title: RAGAL: A Frugal, Fully Local Retrieval-Augmented Assistant for Technical Support at a Government Agency
- Title(参考訳): RAGAL: 官庁の技術支援のためのフルローカル検索アシスタント
- Abstract要約: RAGALは、ルーマニア農村投資庁(AFIR)の技術支援チームの検索強化アシスタントである。
AFIRの技術支援チームのための検索強化アシスタントであるRAGALについて報告する。
平均的な投資は検索工学と検索器の微調整である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Public institutions hold large volumes of sensitive documents and support tickets that cannot leave the premises, ruling out cloud-hosted language models entirely. We report on RAGAL, a retrieval-augmented assistant for the technical-support team of AFIR, the Romanian Agency for Financing Rural Investments, built and operated under three hard constraints: zero data egress (no external API calls, even for synthetic data), a read-only mandate (the assistant drafts, humans execute), and a single 8 GB consumer laptop as the only development and training machine. Over a Romanian-language corpus of ~25,000 chunks -- 15,073 resolved support tickets and internal normative documents -- we show that the highest-leverage investments were retrieval engineering and retriever fine-tuning rather than a larger generator: hybrid dense-sparse retrieval with intent routing raised our internal evaluation from 62% to 81%, and fine-tuning the bge-m3 embedder on real ticket data improved recall@10 from 0.663 to 0.850 (MRR 0.489 to 0.684) after 72 minutes of training. We document a general pitfall: single-domain fine-tuning silently degraded retrieval on the untouched document domain below the stock baseline, detected only after building a per-domain evaluation set and repaired with locally generated queries (GenQ). We report two counter-intuitive findings -- PII masking improved generation quality, and a structural "anchor distillation" scheme made SQL hallucination impossible by construction -- along with a reproducible recipe for full embedder fine-tuning in 8 GB of VRAM. Finally, since zero egress also rules out a cloud judge, we describe a substitute: a 744B-parameter model run on CPU, too slow to serve interactively but affordable in overnight batch, used as a second opinion whose limits we quantify. We release the sanitized pipeline scripts for institutions facing similar data-locality constraints.
- Abstract(参考訳): 公共機関は、大量の機密文書を保持し、クラウドでホストされる言語モデルを完全に除外して、敷地を離れることができないチケットをサポートします。
AFIRの技術支援チームのための検索強化アシスタントであるRAGALについて報告する。ルーマニア農村投資庁は、ゼロデータエクスプレス(外部APIコールなし、合成データなし)、リードオンリーの委任(アシスタントドラフト、人間による実行)、そして1台の8GBの消費者向けラップトップを開発・トレーニングマシンとして構築し、運用している。
25,000チャンクのルーマニア語コーパス -- 15,073の解決されたサポートチケットと内部規範文書 -- を通じて、最も高い投資は、より大きなジェネレータではなく、検索エンジニアリングとレトリバーの微調整だった。
ドメイン単位の評価セットを構築した後にのみ検出され、局所的に生成されたクエリ(GenQ)で修復される。
PIIマスキングにより生成品質が向上し、構造的「アンカー蒸留」スキームによってSQL幻覚は構築が不可能となり、また8GBのVRAMで完全な埋め込みを微調整するための再現可能なレシピが報告された。
744BパラメータモデルはCPU上で動作し、対話的に動作するには遅すぎるが、一晩のバッチでは手頃な価格で提供でき、限界を定量化する第2の意見として使われる。
同様のデータ局所性制約に直面した機関に対して、衛生化されたパイプラインスクリプトをリリースする。
関連論文リスト
- From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - Cloud and On-Premises Deployment of Uzbek Legal RAG via Targeted Retriever Fine-Tuning [0.0]
本稿では,ウズベクにおける2つの体制で行う必要がある検索強化型法務助手(RAG)の構築と運用について報告する。
マネージドクラウドサービスは、トーケン当たりのコスト天井内での回答品質を最大化し、法的データがインフラストラクチャを離れない可能性のあるクライアントのオンプレミスデプロイメントを最大化する。
この設定には評価がなかったため、専門家による178の法定クエリと、専門家による504の問合せ対のエンドツーエンドベンチマークの2つのドメインベンチマークを構築した。
論文 参考訳(メタデータ) (2026-08-29T14:07:39Z) - Domain-Adapted Small Language Models with Hybrid Post-Processing: Achieving Cost-Efficient, Low-Latency Multi-Label Structured Prediction via LoRA Fine-Tuning on Scarce Data [6.3745740668603075]
ドメイン固有の構造化評価タスクのための大規模言語モデル(LLM)は、遅延、コスト、データプライバシオーバーヘッドを禁止します。
本稿では,219個のキュレートされた例に対して,小さな言語モデルを微調整し,決定論的ルールベースの後処理層と結合するハイブリッドフレームワークを提案する。
本システムでは,53件の未確認原稿のブラインド評価において,100%の構造的妥当性,83.0%の人間検証精度,および最重要分類分野における100%の精度を実現している。
論文 参考訳(メタデータ) (2026-06-04T07:09:37Z) - DocAtlas: Multilingual Document Understanding Across 80+ Languages [58.715440331861295]
本稿では,82言語を対象とした高忠実度OCRデータセットとベンチマークを構築するフレームワークDocAtlasを紹介する。
我々のデュアルパイプライン、ネイティブDOCX文書の微分レンダリング、左右スクリプトの合成ベース生成は正確な構造アノテーションを生成する。
論文 参考訳(メタデータ) (2026-05-12T18:09:38Z) - ClawEnvKit: Automatic Environment Generation for Claw-Like Agents [85.29126619772153]
我々は、オンデマンドで検証された環境を生成することができる自動生成パイプラインであるClawEnvKitを紹介する。
ClawEnvKitは、(1)自然言語入力から構造化生成パラメータを抽出するパイプライン、(2)タスク仕様、ツールインターフェース、スコアリング設定を生成するジェネレータ、(3)実現可能性、多様性、構造的妥当性、内部整合性を強制するバリデータからなる。
爪のようなエージェントの大規模なベンチマークであるAuto-ClawEvalを構築し、24のカテゴリで1,040の環境を網羅した。
論文 参考訳(メタデータ) (2026-04-20T17:36:49Z) - Towards Intelligent Legal Document Analysis: CNN-Driven Classification of Case Law Texts [1.3192560874022086]
本研究は,引用処理分類のための軽量かつ高精度なフレームワークを提案する。
単語認識型FastText埋め込みと1次元畳み込みニューラルネットワーク(CNN)との補間に基づく前処理を併用する。
提案システムは97.26%の分類精度と96.82%のマクロF1スコアを達成し,既存のベースラインを超えている。
論文 参考訳(メタデータ) (2026-04-20T00:14:11Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Quecto-V1: Empirical Analysis of 8-bit Quantized Small Language Models for On-Device Legal Retrieval [0.0]
本稿では、インドの法律情報へのアクセスを民主化するために設計されたドメイン固有小言語モデル(SLM)であるQuecto-V1を紹介する。
Quecto-V1は、インド刑法典(IPC)、刑事訴訟法典(CrPC)、インド憲法などのインド法典のコーパスのみに基づいて、ゼロから訓練された。
本稿では,Quecto-V1が法定定義と罰則の検索において高い忠実性を達成し,ドメイン固有の正確なマッチングタスクにおいて汎用SLMよりも優れた性能を示すことを示す。
論文 参考訳(メタデータ) (2026-02-18T17:29:43Z) - YourBench: Easy Custom Evaluation Sets for Everyone [12.995134931278056]
YourBenchは、大規模言語モデル(LLM)を評価するための、新しいオープンソースのフレームワークである。
手動のアノテーションなしで、信頼性が高く、最新で、ドメインに適したベンチマークを安価に生成する。
我々はTemporaに基づくYourBenchライブラリ、Tempora-0325データセット、150k以上の質問応答ペア、およびすべての評価と推論トレースをリリースする。
論文 参考訳(メタデータ) (2025-04-02T15:40:24Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore [159.21914121143885]
推論中にこのリスクパフォーマンストレードオフを管理する新しい言語モデルであるSILOを提案する。
SILOは(1)オープンライセンスコーパス(OLC)上でパラメトリックLMをトレーニングすることで構築されます。
データストアへのアクセスはドメインのパフォーマンスを大幅に改善し、PileでトレーニングされたLMでパフォーマンスギャップの90%を閉じる。
論文 参考訳(メタデータ) (2023-08-08T17:58:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。