論文の概要: Towards Expert Financial QA via Self-Improving RAG
- arxiv url: http://arxiv.org/abs/2608.26706v1
- Date: Thu, 27 Aug 2026 07:01:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.281229
- Title: Towards Expert Financial QA via Self-Improving RAG
- Title(参考訳): 自己改善RAGによる専門的金融QAに向けて
- Abstract要約: 自己改善RAGは文書QAを3つの特殊エージェントに分解するフレームワークである。
Retrieval, Reasoning, judgeは、フィードバック駆動の自己補正を備えたオーケストレータによって調整される。
我々は、自己改善RAGが約86%のオラクル誘導精度を36.4%のラザラスレートで達成するファイナンスベンチ(SECの申請QA)を評価する。
- 参考スコア(独自算出の注目度): 2.1042118213583394
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Expert-level financial question answering requires both grounded verification to catch numeric hallucinations and audit trails for regulatory compliance, attributes that standard single-pass RAG systems lack. We take a step toward this goal with Self-Improving RAG, a framework that decomposes document QA into three specialized agents (Retrieval, Reasoning, and Judge) coordinated by an orchestrator with feedback-driven self-correction. When the Judge Agent scores an answer below a dynamic threshold, the system triggers retry with escalated strategies: broader retrieval, more careful prompting, and relaxed acceptance criteria. We evaluate on FinanceBench (SEC filing QA), where Self-Improving RAG achieves 86% oracle-guided accuracy (measuring agreement with gold answers) with a 36.4% Lazarus Rate, recovering nearly 4 in 10 initially incorrect answers through targeted retry. A key finding is that a fixed retrieval pipeline with judge-driven retry achieves strong results without dynamic routing, providing full interpretability. Every decision is logged with confidence scores, enabling the audit trails required for regulated financial applications.
- Abstract(参考訳): 専門家レベルの財務問題への回答には、数値的な幻覚を捉えるための根拠付き検証と、標準の単一パスRAGシステムに欠けている属性である規制遵守のための監査パスの両方が必要である。
我々は、文書QAを、フィードバック駆動の自己補正を備えたオーケストレータによって調整された3つの特殊エージェント(検索、推論、審査)に分解するフレームワークであるSelf-Improving RAGにより、この目標に向かって一歩前進する。
審査員がダイナミックなしきい値を下回ると、システムはより広範な検索、より慎重なプロンプト、緩やかな受け入れ基準という、エスカレートされた戦略でリトライをトリガーする。
我々は、自己改善RAGが86%のオラクル誘導精度を36.4%のラザラスレートで達成し、ターゲットの再試行を通じて10人に4人に1人近くが不正確な回答を回復したファイナンスベンチ(SECの申請QA)を評価する。
重要な発見は、判断駆動の再試行を伴う固定された検索パイプラインが動的ルーティングなしで強力な結果を達成し、完全な解釈可能性を提供することである。
すべての決定には信頼スコアが記録され、規制された金融アプリケーションに必要な監査証跡を可能にする。
関連論文リスト
- RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation [11.869490719319577]
CalibratedRubricは、タイプ固有のスコアリング、ベイジアンルーブリック可測性フィルタリング、およびアイテム応答理論(IRT)ベースの銀行アセンブリを組み合わせたタスク適応フレームワークである。
財務、医療、一般、法的なベンチマーク全体にわたって、測定可能性のフィルタリングは、人間と金の合意を改善する。
IRTベースのグリーディセレクションは、ランダムセレクションよりもクロスフィットなランクフィデリティを改善する。
論文 参考訳(メタデータ) (2026-07-31T10:21:56Z) - AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA [7.135926644099901]
我々はAgentFinVQAを提案する。AgentFinVQAはマルチエージェントパイプラインで、各クエリをプランニング、OCR、レジェンドグラウンド、ビジュアルインスペクション、検証に分解する。
FinMMEでは、AgentFinVQAはプロプライエタリなバックボーンを持つゼロショットベースラインにマッチするプライマリバックボーンよりも$+7.68$ ppを改善している。
誤り分析は、疑問の誤解、伝説の混乱、抽出誤りが失敗の3分の2近くを占めていることを示している。
論文 参考訳(メタデータ) (2026-06-18T04:33:07Z) - ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents [48.80766702702854]
LLMベースの検索エージェントは、主に結果のみの報酬で訓練され、検索プロセス自体は監督されていない。
この信号は、全てのサンプル軌跡が同じ正当性を共有する結果同質な群に対して退化し、群内の優位性はゼロとなり、勾配は得られない。
ARBOR(Adaptive Buffer for Online Reward)は,クエリ間で共有されるルーリックメモリを維持する再利用可能なプロセス・リワードフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T06:58:54Z) - Agentic Retrieval-Augmented Generation for Financial Document Question Answering [7.56842616602779]
FinAgent-RAGは、反復的な検索推論ループを自己組織化してオーケストレーションするエージェントRAGフレームワークである。
コントラシティブ・ファイナンシャル・レトリバー(Contrastive Financial Retriever)は、意味的には似ているが数値的に異なる金融パスを区別するために、厳しい負の採掘で訓練されたコントラシティブ・ファイナンシャル・レトリバーを統合している。
76.81%、78.46%、74.96%の精度で最強のベースラインを5.62-9.32ポイント上回っている。
論文 参考訳(メタデータ) (2026-05-06T19:59:51Z) - URAG: A Benchmark for Uncertainty Quantification in Retrieval-Augmented Large Language Models [35.441039437111606]
URAGは、医療、プログラミング、科学、数学、一般的なテキストなど、さまざまな分野にわたるRAGシステムの不確実性を評価するために設計されたベンチマークである。
評価パイプラインを8つの標準RAG手法に適用し,LACとAPSの計測値に基づいて,精度と予測セットのサイズを両立させ,その性能を計測する。
論文 参考訳(メタデータ) (2026-03-02T00:22:06Z) - Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification [71.98473277917962]
近年のDeep Research Agents (DRA) の進歩は、自動知識発見と問題解決に変化をもたらしている。
本稿では,政策モデルのアウトプットを反復的に検証することで,エージェントの能力を自己進化させる手法を提案する。
検証の非対称性を生かしたルーブリックスに基づく結果報酬検証器であるDeepVerifierを提案する。
論文 参考訳(メタデータ) (2026-01-22T09:47:31Z) - Evaluating Retrieval-Augmented Generation Systems on Unanswerable, Uncheatable, Realistic, Multi-hop Queries [53.99620546358492]
実世界のユースケースでは、複雑なクエリを持つRAGシステムが存在し、関連する情報がコーパスから欠落したり、不完全であったりすることが多い。
既存のRAGベンチマークは、マルチホップやスコープ外の質問に対して、現実的なタスクの複雑さを反映することはめったにない。
un$underlinec$heatable, $underliner$ealistic, $underlineu$nanswerable, $underlinem$ulti-hopの自動生成のための最初のパイプラインを提示する。
論文 参考訳(メタデータ) (2025-10-13T21:38:04Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Unanswerability Evaluation for Retrieval Augmented Generation [74.3022365715597]
UAEval4RAGは、RAGシステムが解答不能なクエリを効果的に処理できるかどうかを評価するために設計されたフレームワークである。
我々は、6つの未解決カテゴリを持つ分類を定義し、UAEval4RAGは、多様で挑戦的なクエリを自動的に合成する。
論文 参考訳(メタデータ) (2024-12-16T19:11:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。