論文の概要: FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking
- arxiv url: http://arxiv.org/abs/2605.05482v1
- Date: Wed, 06 May 2026 22:04:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.431263
- Title: FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking
- Title(参考訳): FinRAG-12B:銀行業務における接地質問応答のための生産検証
- Authors: Denys Katerenchuk, Pablo Duboue, Keelan Evanini, David Gondek, Nithin Govindugari, Olivier Allauzen, Joshua Baptiste, David J More, Joshua Schechter,
- Abstract要約: 大規模言語モデル(LLM)をトレーニングするための統合されたデータ効率フレームワークを提案する。
実際のデプロイメント制約の下で、回答の品質、引用グラウンド、キャリブレーション、拒否を最適化します。
システムは40以上の金融機関で展開され、クエリの解決で7.1ポイント改善されている。
- 参考スコア(独自算出の注目度): 0.6356558256426569
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are rapidly being adopted across various domains. However, their adoption in banking industry faces resistance due to demands for high accuracy, regulatory compliance, and the need for verifiable and grounded responses. We present a unified, data-efficient framework for training grounded domain-specific LLMs that optimizes answer quality, citation grounding, and calibrated refusal under real-world deployment constraints. First, we describe a data generation pipeline that combines LLM-as-a-Judge filtering, citation annotation, and curriculum learning with only 143M tokens. The resulting 12B model achieves high answer quality outperforming GPT-4.1 on citation grounding, with a modest citation tradeoff versus the untuned base. Second, we propose a calibrated refusal mechanism: training on 22% unanswerable examples yield a 12% "I don't know" rate, substantially improving over the base model's unsafe 4.3% rate while avoiding GPT-4.1's over-refusal (20.2%). Third, we present an end-to-end methodology spanning from data curation to quantized serving. The system is deployed at 40+ financial institutions, achieving a 7.1 percentage point improvement in query resolution (p < 0.001). Additionally, the model delivers 3-5x faster responses at 20-50x lower cost compared to GPT-4.1.
- Abstract(参考訳): 大規模言語モデル(LLM)は、様々な領域で急速に採用されている。
しかし、銀行業界への導入は、高い正確性、規制の遵守、検証と根拠のある対応の必要性による抵抗に直面している。
実世界の展開制約下での応答品質, 励振グラウンド, 校正拒否を最適化する, 接地型ドメイン固有LLMをトレーニングするための, 統一的でデータ効率のよいフレームワークを提案する。
まず、LLM-as-a-Judgeフィルタリング、引用アノテーション、カリキュラム学習をわずか143Mトークンで組み合わせたデータ生成パイプラインについて述べる。
結果として得られた12Bモデルは、励振接地におけるGPT-4.1よりも高い応答品質を達成する。
第二に、22%の未確認例に対するトレーニングは、12%の"I don't know"率をもたらし、GPT-4.1のオーバーリファリング(20.2%)を回避しつつ、ベースモデルの安全でない4.3%よりも大幅に改善する。
第3に,データキュレーションから定量化サービスまで,エンドツーエンドの方法論を提案する。
システムは40以上の金融機関で展開され、クエリの解像度が7.1ポイント改善されている(p < 0.001)。
さらに、GPT-4.1に比べて20~50倍の低コストで3~5倍高速な応答を提供する。
関連論文リスト
- FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification [13.891522069967507]
FinGroundは、ファイナンシャルドキュメントQAのための検証済みの地上パイプラインである。
ステージ1は、テキストとテーブル上でファイナンス対応のハイブリッド検索を行う。
ステージ2は6種類の財政分類で分類された原子的主張に答えを分解する。
ステージ3は、段落とテーブルセルレベルの引用で、サポートされたクレームを書き換える。
論文 参考訳(メタデータ) (2026-04-26T07:52:59Z) - Hybrid Deep Learning Approach for Coupled Demand Forecasting and Supply Chain Optimization [0.21990652930491858]
本稿では,需要供給予測と最適化のためのハイブリッドAIフレームワーク(HAF-DS)を提案する。
LSTM(Long Short-Term Memory)ベースの需要予測モジュールと混合整数線形プログラミング(MILP)最適化層を統合している。
繊維販売とサプライチェーンデータセットの実験は、統計的およびディープラーニングベースラインよりも顕著なパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-04-23T11:38:59Z) - An Empirical Investigation of Practical LLM-as-a-Judge Improvement Techniques on RewardBench 2 [0.0]
微調整なしでRewardBench 2のGPT-5.4判定精度を向上させる手法を提案する。
2つのテクニックは、タスク固有の基準注入とアンサンブルスコアという、ほぼすべての利得を考慮に入れている。
さらに3つのテクニックは、基準とアンサンブルを同等のコストで確実に改善しなかった。
論文 参考訳(メタデータ) (2026-04-15T10:52:33Z) - Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration [0.0]
マルチターンタスクにおける強化学習を伴う訓練ツール呼び出しエージェントは依然として困難である。
本稿では,MT-GRPO と GTPO を用いて,現実的なカスタマーサービスタスクにおけるツールコールエージェントのトレーニングを行う。
論文 参考訳(メタデータ) (2026-04-03T08:36:03Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - Enhancing Financial Report Question-Answering: A Retrieval-Augmented Generation System with Reranking Analysis [12.26184264751935]
S&P 500 財務報告に関する質問に答えるために設計された検索補助生成システム。
システムは、フルテキストとセマンティック検索を組み合わせたハイブリッド検索を採用し、その後、オプションで再ランク付けを行う。
リグレードは回答の質を大幅に改善し、8点以上のスコアに対して49.0パーセントの正当性を達成する。
論文 参考訳(メタデータ) (2026-02-18T20:54:23Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Retrieval-Augmented Generation for Reliable Interpretation of Radio Regulations [49.671779378073886]
無線規制分野における質問応答について検討する。
本稿では,通信事業者固有のレトリーバル拡張生成(RAG)パイプラインを提案する。
当社のアプローチは,テスト対象モデル全体の生成精度を一貫して向上させる。
論文 参考訳(メタデータ) (2025-09-11T17:43:42Z) - Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs [54.05511925104712]
本稿では,Step-DPOと呼ばれるシンプルで効果的でデータ効率のよい手法を提案する。
Step-DPOは、個々の推論ステップを、論理的に回答を評価するのではなく、優先最適化の単位として扱う。
以上の結果から,70B パラメータ以上のモデルでは,10K の選好データペアと500 Step-DPO トレーニングステップ以下では,MATH の精度が約3%向上する可能性が示唆された。
論文 参考訳(メタデータ) (2024-06-26T17:43:06Z) - Clustering and Ranking: Diversity-preserved Instruction Selection through Expert-aligned Quality Estimation [56.13803674092712]
本稿では,産業に優しく,専門家に順応し,多様性に配慮した指導データ選択手法を提案する:クラスタリングとランキング(CaR)
CaRは2段階のプロセスを採用している: まず、専門家の好みに合わせた高精度(84.25%)のスコアリングモデルを使用して、命令ペアをランク付けする。
我々の実験では、CaRはAlpacaのITデータのわずか1.96%を効率よく選択したが、結果のAlpaCaRモデルはGPT-4の評価において平均32.1%の精度でAlpacaのパフォーマンスを上回った。
論文 参考訳(メタデータ) (2024-02-28T09:27:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。