論文の概要: CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA
- arxiv url: http://arxiv.org/abs/2608.13706v2
- Date: Tue, 18 Aug 2026 12:21:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 13:45:32.85628
- Title: CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA
- Title(参考訳): CLAIR-Fin: クロスモーダルファイナンシャルQAにおけるクレームレベル検証と適応的議論のための多元的多元的フレームワーク
- Authors: Fatema Tuj Johora Faria, Mukaffi Bin Moin, Jubayer Al Mahmud, M. F. Mridha, Md. Alam Hossain,
- Abstract要約: CLAIR-Finは9エージェントのフレームワークで、各質問を型付き金融クレームレジャーで保持される原子クレームに分解する。
各クレームは、非対称エビデンス・オーソリティ、カストディーの連鎖検証、アダプティブ・リビュータル・サイクルを通じて解決される。
バングラデシュ銀行年報資料から設定した500のクロスモーダルファイナンス評価であるBB-FinQA-XのCLAIR-Finを評価する。
- 参考スコア(独自算出の注目度): 0.4417991658092448
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing defenses against hallucination in retrieval-augmented and multi-agent pipelines remain partial: evidence is trusted despite modality disagreement, debate verifies an aggregate report rather than individual claims, and such verification occurs only after drafting, leaving inter-agent errors undetected until the final text. To close this gap, we present CLAIR-Fin, a nine-agent framework that decomposes each question into atomic claims maintained in a typed Financial Claim Ledger. Each claim is resolved through Asymmetric Evidence Authority, which conditions evidence trust on claim type rather than treating all modalities as equally reliable; Chain-of-Custody Verification, which checks grounding at the hand-off between drafting and adversarial review rather than only at the pipeline's exit; an Adaptive Rebuttal Cycle, which routes contested claims through adversarial debate whose depth scales with what that debate finds; and a terminal entailment audit paired with a continuous Hallucination Risk Index that distinguishes claims that passed scrutiny from claims never contested. We evaluate CLAIR-Fin on BB-FinQA-X, a 500-question cross-modal financial evaluation set built from Bangladesh Bank Annual Report material, stratified by query type, format, and difficulty. Relative to a single-pass retrieval-augmented generation baseline, it raises faithfulness ($0.780 \rightarrow 0.889$) while abstaining on 5.4% of questions when evidence is insufficient rather than forcing an unsupported response, and it exceeds stronger retrieval-strategy baselines such as HyDE and Graph-RAG on faithfulness ($\leq 0.874$).
- Abstract(参考訳): 証拠はモダリティの不一致にもかかわらず信頼されており、議論は個々のクレームよりも総合的なレポートを検証し、そのような検証は起草後にのみ発生し、アジェント間エラーは最終文まで検出されない。
このギャップを埋めるために、私たちはCLAIR-Finという9つのフレームワークを紹介します。
各クレームは、すべてのモダリティを平等に扱うのではなく、クレームタイプの信頼性を証明している非対称証拠局(Asymmetric Evidence Authority)、パイプラインの出口に留まらず、起草と敵のレビューの間のハンドオフを根拠にチェックするChain-of-Custody Verification、その議論が発見される範囲を拡大している敵の議論を通じてクレームを経路するAdaptive Rebuttal Cycle、そしてクレームから精査されたクレームを区別する連続的ハロシン化リスク指標(Continuous Hallucination Risk Index)で解決される。
バングラデシュ銀行年次報告書資料から構築した500件のクロスモーダル・ファイナンシャル・アセスメント・セットであるBB-FinQA-XのCLAIR-Finを評価する。
単一パスの検索強化された世代ベースラインとは対照的に、信頼できる(0.780 \rightarrow 0.889$)一方で、証拠がサポートされない応答を強制するのではなく、証拠が不十分である場合の5.4%の質問を棄却し、忠実さについてHyDEやGraph-RAGのようなより強力な検索戦略ベースラインを超える(\leq 0.874$)。
関連論文リスト
- DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - ECO/CPO-DAG: A Contradiction-Based Accountability Layer for Adversarial Supply Chains [0.0]
ECO/CPO-DAGは、敵対的なサプライチェーンのためのドメイン固有の説明責任プロトコルである。
補足検証層として矛盾検出を形式化する。
プロトコルの境界は明示的であり、証明可能な矛盾を検出し、一貫性のある嘘は検出しない。
論文 参考訳(メタデータ) (2026-07-07T21:03:26Z) - Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction [4.273094752480624]
本稿では,対話的証明理論に基づく推論時間プロトコルであるPVDを導入する。
PVDは回答と構造化された信頼判定の両方を生成し、システムは不確実なケースを棄却しながら高信頼の回答を報告できる。
論文 参考訳(メタデータ) (2026-05-24T15:23:27Z) - Preregistered Belief Revision Contracts [2.28438857884398]
PBRC(Preregistered Belief Revision Contracts)は,オープン通信と許容可能な変更を分離するプロトコルレベルのメカニズムである。
PBRC契約は、ファーストオーダーのエビデンストリガー、許容可能なリビジョンオペレータ、優先ルール、フォールバックポリシーを公に修正する。
本報告では,信頼軌道と正準化された監査トレースを保存したPBRC正規形式を,監査可能なトリガープロトコルで認めていることを示す。
論文 参考訳(メタデータ) (2026-04-16T22:22:54Z) - Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification [2.464003792743989]
大型言語モデル (LLM) は、幻覚や浅い推論のため、高い精度のクレーム検証には信頼できないままである。
本稿では, 検証を構造化された, 反対の審議会として再編成する, 裁判所方式のマルチエージェントフレームワーク PROClaim を提案する。
提案手法は,プログレッシブRAG (Progressive RAG, P-RAG) と特別な役割(プレーンティフ, ディフェンス, ジャッジ)を統合し, 議論の間, 証拠プールを動的に拡大・洗練する。
論文 参考訳(メタデータ) (2026-03-30T14:23:15Z) - From Fluent to Verifiable: Claim-Level Auditability for Deep Research Agents [8.49451413641847]
研究生成が安価になるにつれて、監査可能性がボトルネックになる、と我々は主張する。
この観点からは,ディープリサーチエージェントの第一級設計および評価対象として,クレームレベルの監査性を提案する。
論文 参考訳(メタデータ) (2026-02-14T19:39:15Z) - All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection [67.89888669159899]
RFC Benchは、現実的なニュースの下で財務的な誤情報に関する大規模な言語モデルを評価するためのベンチマークである。
このベンチマークでは、2つの補完的なタスクが定義されている。
論文 参考訳(メタデータ) (2026-01-07T18:18:28Z) - From Chaos to Clarity: Claim Normalization to Empower Fact-Checking [57.024192702939736]
Claim Normalization(別名 ClaimNorm)は、複雑でノイズの多いソーシャルメディア投稿を、より単純で分かりやすい形式に分解することを目的としている。
本稿では,チェーン・オブ・ソートとクレーム・チェック・バシネス推定を利用した先駆的アプローチであるCACNを提案する。
実験により, CACNは様々な評価尺度において, いくつかの基準値を上回る性能を示した。
論文 参考訳(メタデータ) (2023-10-22T16:07:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。