論文の概要: Automated Regulatory Compliance Question Answering in Financial Services with Domain-Adapted Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2609.30009v1
- Date: Thu, 24 Sep 2026 15:48:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.067508
- Title: Automated Regulatory Compliance Question Answering in Financial Services with Domain-Adapted Retrieval-Augmented Generation
- Title(参考訳): ドメイン適応型検索機能付き金融サービスにおける自動規制コンプライアンス質問応答
- Abstract要約: 金融機関は高密度で頻繁に修正されたルールブックの下で運営されている。
コンプライアンス質問を正しく答えるには、信頼できるテキストで検証可能な根拠が必要である。
ドメイン適応型検索拡張生成パイプラインがそのギャップを埋めるかどうかを慎重に検討する。
- 参考スコア(独自算出の注目度): 3.233923257834339
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Financial institutions operate under dense, frequently amended rulebooks, and answering a compliance question correctly requires not only fluency but verifiable grounding in the authoritative text. Large language models are attractive for this task, yet the models that firms can realistically deploy on-premise are compact ones, and compact models hallucinate obligations. We study whether a carefully domain-adapted retrieval-augmented generation pipeline closes that gap. Our retriever is built in three stages on top of LegalBERT: entailment tuning that recasts question--passage matching as premise--hypothesis reconstruction, contrastive tuning with in-batch negatives, and score-level fusion with BM25. Our generator is a compact model (2B--12B parameters) served under 4-bit quantization, either prompted or adapted with retrieval-aware fine-tuning (RAFT) through LoRA. On ObliQA, a question-answering benchmark built from the Abu Dhabi Global Market rulebooks, the staged retriever raises Recall@10 from 0.256 to 0.774 and outperforms BM25 (0.678) and E5-large-v2 (0.758), the strongest general-purpose dense encoder we tested. RAFT-LoRA then improves the composite RePASs answer-quality score for every model we could adapt, with the largest gain on the weakest one. However, the adapted models do not transfer to Australian case-law questions, and a closed-book model that receives no passages at all scores within 0.011 RePASs of the full pipeline while producing answers that cite nothing and misstate obligations. The retrieval gain is therefore measured directly, the generation gain is a gain in RePASs rather than demonstrated grounding, and grounding itself requires an evaluation protocol that RePASs does not provide.
- Abstract(参考訳): 金融機関は、厳密で頻繁に修正されたルールブックの下で運営され、コンプライアンス問題に正しく答えるには、寛大さだけでなく、権威的な文章で検証可能な根拠が必要である。
大規模な言語モデルは、このタスクには魅力的なものですが、企業がオンプレミスで現実的にデプロイできるモデルは、コンパクトなもので、コンパクトモデルは義務を幻覚させます。
ドメイン適応型検索拡張生成パイプラインがそのギャップを埋めるかどうかを慎重に検討する。
LegalBERTの3つのステージ上に構築されたレトリバーは,質問-パスマッチングを前提-仮説再構成として再キャストするエンテーメントチューニング,バッチ内負のコントラストチューニング,BM25とのスコアレベル融合である。
我々のジェネレータは、4ビット量子化の下で提供されるコンパクトモデル(2B--12Bパラメータ)であり、LoRAを介してRAFT(Research-Aware fine-tuning)を誘導または適応する。
Abu Dhabi Global Marketのルールブックから構築された質問応答ベンチマークであるObliQAでは、Recall@10を0.256から0.774に引き上げ、BM25 (0.678)とE5-large-v2 (0.758)を上回ります。
RAFT-LoRAは、私たちが適応できるすべてのモデルに対して、RePASの回答品質スコアを改善します。
しかし、適応されたモデルはオーストラリアのケースローの質問に移行せず、完全なパイプラインの0.011 RePASで全てのスコアでパスを受け取らないクローズドブックモデルであり、無や不当な義務を引用する回答を生み出している。
したがって、検索ゲインを直接測定し、生成ゲインはグラウンド化ではなくRePASのゲインであり、グラウンド化自身はRePASが提供しない評価プロトコルを必要とする。
関連論文リスト
- Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge [7.4253318607352155]
Wnuanは文書からタスク指向の監視を構築する3段階のパイプラインである。
707-questionのWnuanBenchでは、32B経路が52.76%から52.76%に上昇し、SFT後80.06%、RL後91.51%に適応した。
論文 参考訳(メタデータ) (2026-08-03T08:11:33Z) - Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models [2.1665689529884697]
本稿では,コンパクトな埋め込みモデルと汎用SLMの2つのコンポーネントからなる効率的なRAGアーキテクチャであるB1adeについて述べる。
5つの事前訓練エンコーダのパラメータフリー融合により構築された335Mパラメータ検索モデルであるB1ade-embedは、追加トレーニングをゼロとした500M未満モデルの上位MTEBスコアを達成する。
B1ade-1Bは42.4%の反応で回収された通路を引用し、トレーニング分布の寄与率を5.5ポイント上回っている。
論文 参考訳(メタデータ) (2026-07-29T22:41:25Z) - EverydayGPT: Confidence-Gated Routing for Efficient and Safe Hybrid GPT-RAG Conversational QA [0.0]
EverydayGPTは、信頼性保証ルーティング機構を中心に構築された軽量な会話型QAシステムである。
CGRは、高速なRAG抽出によって解決することで、クエリの85%に対してコストのかかるGPT経路の呼び出しを回避している。
システムは F1 = 0.226 +/- 0.004 を GPT のみの 0.171 と無条件の RAG の 0.210 と比較すると達成する。
論文 参考訳(メタデータ) (2026-04-24T12:44:26Z) - Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation [45.13215113490545]
GuarantRAGは、証拠統合から推論を明示的に分離するフレームワークである。
5つのQAベンチマークの実験では、GurantRAGは最大で12.1%精度が向上している。
論文 参考訳(メタデータ) (2026-04-09T09:52:21Z) - Can Small Models Reason About Legal Documents? A Comparative Study [0.0]
大規模言語モデルは法的なアプリケーションには有望であるが、フロンティアモデルのデプロイは、コスト、レイテンシ、データプライバシに関する懸念を提起する。
3つの法的なベンチマークで9つのモデルをテストすることにより,サブ10Bパラメータモデルが実用的な代替手段として機能するかどうかを評価する。
論文 参考訳(メタデータ) (2026-03-26T22:28:20Z) - LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning [46.294745464571456]
LongCat-Flash-Proverはエージェントツール統合推論のためのオープンソースのMoEモデルである。
これは、自己形式化と定理証明の両方において、オープンウェイトモデルのための新しい最先端状態を設定する。
MiniF2F-Testのパスレートは97.1%で、72の推論予算しか使用していない。
論文 参考訳(メタデータ) (2026-03-22T05:16:09Z) - Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving [65.02106674311908]
本稿では,マルチラウンド階層的推論を行う長期水平数学エージェントであるIntern-S1-MOを紹介する。
コンパクトメモリをレムマの形で維持することにより、Intern-S1-MOはレムマリッチ推論空間をより自由に探索することができる。
実験の結果、インターンS1-MOはIMO2025の非幾何学的問題で35点中26点を得ることができ、銀メダリストのパフォーマンスに匹敵することがわかった。
論文 参考訳(メタデータ) (2025-12-11T15:26:28Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Retrieval-Augmented Generation for Reliable Interpretation of Radio Regulations [49.671779378073886]
無線規制分野における質問応答について検討する。
本稿では,通信事業者固有のレトリーバル拡張生成(RAG)パイプラインを提案する。
当社のアプローチは,テスト対象モデル全体の生成精度を一貫して向上させる。
論文 参考訳(メタデータ) (2025-09-11T17:43:42Z) - DeAR: Dual-Stage Document Reranking with Reasoning Agents via LLM Distillation [26.719288314007002]
大規模言語モデル(LLM)は、候補集合に対する大域的推論を可能にすることで、リストワイズドキュメントの優先順位を変更している。
textbfDeeptextbfAgenttextbfRank(textbfDeAR)を提案する。
論文 参考訳(メタデータ) (2025-08-23T11:46:08Z) - SFR-RAG: Towards Contextually Faithful LLMs [57.666165819196486]
Retrieval Augmented Generation (RAG) は、外部コンテキスト情報を大言語モデル(LLM)と統合し、事実の精度と妥当性を高めるパラダイムである。
SFR-RAG(SFR-RAG)について述べる。
また、複数の人気かつ多様なRAGベンチマークをコンパイルする新しい評価フレームワークであるConBenchについても紹介する。
論文 参考訳(メタデータ) (2024-09-16T01:08:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。