論文の概要: Fighting Numerical Hallucinations via Data-centric Compilation for Online Financial QA
- arxiv url: http://arxiv.org/abs/2605.31064v1
- Date: Fri, 29 May 2026 09:35:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.512217
- Title: Fighting Numerical Hallucinations via Data-centric Compilation for Online Financial QA
- Title(参考訳): オンライン金融QAのためのデータ中心コンパイルによる数値幻覚対策
- Abstract要約: 大規模言語モデル(LLM)は、特に金融質問応答(FinQA)の分野において、非常に高度なオンラインデータサービスを持っている。
しかし、これらのシステムは、高額の金融アプリケーションにおいて信頼性を著しく損なう、数値的推論幻覚の影響を受けやすいままである。
データ中心のパラダイムを提案し、新しいフレームワークであるData-centric Reasoning Compiler(DCRC)を提案する。
我々は、確立したオフラインベンチマークに関する広範な実験を行い、実世界のオンライン財務QAシステムへの展開を通じて、我々のフレームワークをさらに検証する。
- 参考スコア(独自算出の注目度): 14.141735278960766
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large Language Models (LLMs) have significantly advanced online data services, particularly in the domain of financial question answering (FinQA). However, such systems remain susceptible to numerical reasoning hallucinations, which critically undermine reliability in high-stakes financial applications. Although retrieval-augmented generation (RAG) has been widely adopted to ground responses in external knowledge, it introduces three persistent challenges: noise sensitivity, calculation fragility, and an auditability crisis. Existing model-centric approaches, which primarily focus on optimizing either the retriever or generator in isolation, still struggle to address these issues in an integrated manner. In this work, we pioneer a data-centric paradigm and propose a novel framework, the Data-centric Reasoning Compiler (DCRC). The framework operates through three cohesive phases: (1) adversarial data construction, which synthesizes training examples with controlled noise to teach robustness; (2) multi-stage training that cultivates a Data-centric Structuring Agent (DSA) capable of explicit evidence auditing and program synthesis; and (3) a compile-and-execute inference process, where the DSA transforms user queries and retrieved documents into verifiable, executable reasoning programs. This data-driven framework ensures faithful numerical reasoning by design. We conduct extensive experiments on established offline benchmarks and further validate our framework through deployment in a real-world online financial QA system.
- Abstract(参考訳): 大規模言語モデル(LLM)は、特に金融質問応答(FinQA)の分野において、非常に高度なオンラインデータサービスを持っている。
しかし、これらのシステムは、高額の金融アプリケーションにおいて信頼性を著しく損なう、数値的推論幻覚の影響を受けやすいままである。
検索強化世代 (RAG) は, 外部知識の接地応答に広く採用されているが, ノイズ感度, 計算脆弱性, 監査性危機という3つの難題が提起されている。
既存のモデル中心のアプローチは、主にレトリバーまたはジェネレータを分離して最適化することに重点を置いているが、これらの問題に統合的な方法で対処するのに依然として苦労している。
本研究では,データ中心のパラダイムを開拓し,データ中心のReasoning Compiler (DCRC) という新しいフレームワークを提案する。
本フレームワークは,(1)強靭性を教えるために制御ノイズでトレーニング例を合成する逆データ構築,(2)明示的な証拠監査とプログラム合成が可能なデータ中心構造化エージェント(DSA)を育成する多段階学習,(3)ユーザクエリと検索した文書を検証可能な実行可能な推論プログラムに変換するコンパイル・実行推論プロセス,の3段階からなる。
このデータ駆動フレームワークは、設計による忠実な数値推論を保証する。
我々は、確立したオフラインベンチマークに関する広範な実験を行い、実世界のオンライン財務QAシステムへの展開を通じて、我々のフレームワークをさらに検証する。
関連論文リスト
- VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora [24.484384823423216]
既存のベンチマークでは、情報ノイズを考慮せず、複数ソースの事実矛盾を無視し、論理的計画に視覚的認識を根ざす必要性を見落としている。
エージェントの堅牢性と信頼性の増大に対応するために設計された検証可能なベンチマークであるVeriTripを紹介する。
論文 参考訳(メタデータ) (2026-05-27T16:14:47Z) - FERA: Uncertainty-Aware Federated Reasoning for Large Language Models [60.52562148874846]
我々は、サーバがプライベートなデモンストレーションを行う異種クライアントと協調することで、多段階推論を改善するフェデレーション推論について研究する。
重要な課題は、クライアントの信頼性がクエリ依存であるのに対して、サーバはクライアントデータを検査して、どのコントリビューションが信頼できるかを判断できません。
本稿では,サーバクライアントの反復的コリファインメントに基づくトレーニングフリーフレームワークである Uncertainty-Aware Federated Reasoning (FERA) を提案する。
論文 参考訳(メタデータ) (2026-05-11T07:04:51Z) - Dual-Loop Control in DCVerse: Advancing Reliable Deployment of AI in Data Centers via Digital Twins [9.44096782663678]
深層強化学習(DRL)は知的制御の強い可能性を示しているが、ミッションクリティカルなシステムへの展開はデータ不足とリアルタイム事前評価機構の欠如によって制限されている。
本稿では,デジタルツインベースアーキテクチャであるDual-Loop Control Framework (DLCF)を紹介する。
このフレームワークは物理システム、デジタルツイン、多種多様なDRLエージェントのポリシー貯水池の3つのコアエンティティで構成されている。
論文 参考訳(メタデータ) (2026-04-08T20:01:34Z) - Leveraging LLM Parametric Knowledge for Fact Checking without Retrieval [60.25608870901428]
信頼性は、大規模言語モデル(LLM)上に構築されたエージェントAIシステムの中核研究課題である
本研究では,任意の自然言語クレームの検証に焦点をあて,検索なしで事実チェックを行うタスクを提案する。
論文 参考訳(メタデータ) (2026-03-05T18:42:51Z) - Bridging the Arithmetic Gap: The Cognitive Complexity Benchmark and Financial-PoT for Robust Financial Reasoning [11.522192050185568]
大規模言語モデルは,「認知的幻覚」と「認知的崩壊」というシステム的失敗モードに悩まされる
実世界95の中国Aシェア年次レポートから構築したデータセットをベースとした,堅牢な評価フレームワークであるCognitive Complexity Benchmark(CCB)を紹介する。
本稿では,これらの障害に対処するための反復的デュアル・パース・ファイナンシャル・PoTフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T01:33:33Z) - VeritasFi: An Adaptable, Multi-tiered RAG Framework for Multi-modal Financial Question Answering [31.334698403426245]
金融セクターにおける質問回答 (QA) には, RAG (Retrieval-Augmented Generation) がますます重要になっている。
We present VeritasFi, a innovative hybrid RAG framework that with a multi-modal preprocessing pipeline。
提案した設計を統合することで、VeritasFiは金融RAGシステムの適応性と堅牢性を大幅に向上する画期的なフレームワークを提供する。
論文 参考訳(メタデータ) (2025-10-12T22:45:24Z) - CoDA: Agentic Systems for Collaborative Data Visualization [57.270599188947294]
深層研究はデータ分析に革命をもたらしたが、データサイエンティストは依然として手作業による視覚化にかなりの時間を費やしている。
単純なシングルエージェントシステムやマルチエージェントシステムを含む既存のアプローチは、しばしばタスクを単純化する。
本稿では,メタデータ分析,タスク計画,コード生成,自己回帰に特殊なLLMエージェントを利用するマルチエージェントシステムであるCoDAを紹介する。
論文 参考訳(メタデータ) (2025-10-03T17:30:16Z) - Learning to Route: A Rule-Driven Agent Framework for Hybrid-Source Retrieval-Augmented Generation [55.47971671635531]
大言語モデル(LLM)は、一般質問回答(QA)において顕著な性能を示した。
Retrieval-Augmented Generation (RAG)は、LLMを外部知識で強化することで、この制限に対処する。
既存のシステムは、主に構造化されていないドキュメントに依存しているが、主にリレーショナルデータベースを見下ろしている。
論文 参考訳(メタデータ) (2025-09-30T22:19:44Z) - Divide-Then-Align: Honest Alignment based on the Knowledge Boundary of RAG [51.120170062795566]
本稿では,問合せが知識境界外にある場合の"I don't know"で応答する機能を備えたRAGシステムを実現するためのDTAを提案する。
DTAは適切な棄権と精度のバランスをとり、検索強化システムの信頼性と信頼性を高める。
論文 参考訳(メタデータ) (2025-05-27T08:21:21Z) - MIBP-Cert: Certified Training against Data Perturbations with Mixed-Integer Bilinear Programs [50.41998220099097]
トレーニング中のデータエラー、汚職、中毒攻撃は、現代のAIシステムの信頼性に大きな脅威をもたらす。
混合整数双線形プログラミング(MIBP)に基づく新しい認証手法MIBP-Certを紹介する。
摂動データや操作データを通じて到達可能なパラメータの集合を計算することで、可能なすべての結果を予測することができ、堅牢性を保証することができる。
論文 参考訳(メタデータ) (2024-12-13T14:56:39Z) - Soundness of Data-Aware Processes with Arithmetic Conditions [8.914271888521652]
データペトリネット(DPN)は、単純さと表現性のバランスをとる能力によって、人気が高まっている。
データと制御フローの相互作用は、そのようなモデルの正しさ、特に音の良さ、決定的かつ困難さの確認を可能にする。
算術データ条件に富んだDPNの音質を評価するための枠組みを提供する。
論文 参考訳(メタデータ) (2022-03-28T14:46:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。