論文の概要: Bayesian Uncertainty Propagation for Agentic RAG Pipelines: A Proof-of-Concept Study on Multi-Hop Question Answering
- arxiv url: http://arxiv.org/abs/2607.00972v1
- Date: Wed, 01 Jul 2026 14:08:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.929257
- Title: Bayesian Uncertainty Propagation for Agentic RAG Pipelines: A Proof-of-Concept Study on Multi-Hop Question Answering
- Title(参考訳): エージェントRAGパイプラインに対するベイズ的不確実性伝播 : マルチホップ質問応答の実証的研究
- Abstract要約: 本稿では,設計者,評価者,生成者が不確実性信号を生成する,不確実性を考慮したエージェント検索・拡張生成(RAG)フレームワークを提案する。
信号はベイズネットワーク(BN)を介して伝播し、システムレベルの不確実性を推定する。
この研究は、ベイズの不確実性伝播をエージェントRAGシステムを監視するための有望だが予備的なメカニズムとして位置づけている。
- 参考スコア(独自算出の注目度): 0.4666493857924357
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Trustworthy deployment of Agentic Retrieval-Augmented Generation (RAG) systems requires mechanisms for estimating when multi-stage reasoning pipelines may fail. This paper presents an uncertainty-aware Agentic Retrieval-Augmented Generation (RAG) framework in which planner, evaluator and generator stages produce uncertainty signals derived from semantic divergence and generator self-evaluation. These signals are propagated through a Bayesian Network (BN) to estimate system-level uncertainty and provide node-level indicators of potential failure points across the workflow. The approach is evaluated on StrategyQA and HotpotQA using GPT-3.5-Turbo and GPT-4.1-Nano, with Area Under the Receiver Operating Characteristic Curve (AUROC), Area Under the Accuracy-Rejection Curve (AUARC), Expected Calibration Error (ECE), and Brier Score used to assess discrimination, selective prediction and calibration. Results show that Bayesian propagation is more effective on HotpotQA, where uncertainty accumulates across multi-hop reasoning stages, while StrategyQA exposes limitations caused by miscalibration and unreliable upstream signals. The study positions Bayesian uncertainty propagation as a promising but preliminary mechanism for monitoring Agentic RAG systems, with future validation required in industrial domains such as Offshore Wind (OSW) maintenance decision support.
- Abstract(参考訳): Agentic Retrieval-Augmented Generation (RAG) システムの信頼できるデプロイには,マルチステージ推論パイプラインの障害発生時の推定機構が必要である。
本稿では,計画立案者,評価者,生成者の各段階が意味的発散と生成者自己評価から導かれる不確実性信号を生成する,不確実性を考慮したエージェント検索・拡張生成(RAG)フレームワークを提案する。
これらの信号はベイズネットワーク(BN)を介して伝播され、システムレベルの不確実性を推定し、ワークフロー全体の潜在的な障害点のノードレベルインジケータを提供する。
この手法は、GPT-3.5-TurboとGPT-4.1-Nanoを用いてStrategyQAとHotpotQAで評価され、AUROC、AUARC、ECE、Brier Scoreで識別、選択的予測、校正を行う。
以上の結果から,マルチホップ推論段階において不確実性が蓄積するホットポットQAではベイズ伝播がより効果的であることが示唆された。
本研究は,オフショアウィンド(OSW)保守決定支援などの産業領域において,ベイズ的不確実性伝播をエージェントRAGシステム監視の有望かつ予備的なメカニズムとして位置づける。
関連論文リスト
- AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation [48.55515767840701]
AIスロープ(AI slop)は、アーティファクト、幻覚的脆弱性、可視だが正しくないパッチ、セマンティックに再パッケージされたバグレポートである。
本稿では,実証的証拠を調査し,統一メカニズムを特定し,信頼に値するトリアージへの道筋をたどる。
論文 参考訳(メタデータ) (2026-08-26T11:48:38Z) - Knowing When to Ask for Help: Bayesian Self-Escalation in Hierarchical LLM Agents [0.0]
現在のエージェントシステムは、推論を開始する前にデリゲートを決定する。
我々は第3の体制について研究し、それは成功しそうもないと自覚するエージェントである。
論文 参考訳(メタデータ) (2026-08-25T05:35:07Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - Conformal Changepoint Localization and Root Cause Analysis with Corrupted Observations [55.76952683833966]
本稿では,データ破損時の信頼性設定サイズを低減するために,重み付きCONCH(W-CONCH)と重み付きCROC(W-CROC)を提案する。
画像ベースおよび実世界の変化点と根本原因ベンチマークの実験は、不確実性ベースの重み付けが信頼性セットのサイズを大幅に減少させることを示している。
論文 参考訳(メタデータ) (2026-07-29T05:16:59Z) - Runtime Uncertainty Monitoring for LLM-Based Multi-Agent Systems Using Bayesian Networks [0.0]
本稿では,マルチエージェントシステムがアクチュアリリスクモデリングをどのようにサポートするかを検討する。
主な貢献は、トークンレベルの対数確率とベイズネットワークを用いた不確実性伝播に対する新しいアプローチである。
論文 参考訳(メタデータ) (2026-07-28T15:39:43Z) - Covariance-Boosted Gaussian Processes for Spatiotemporal Irregularities [0.0]
本稿では,衛星ベースの拡張システムのための電離層モデリングにより,共分散ブーストガウス過程(CBGP)フレームワークを提案する。
CBGPモデルの有効性とロバスト性は、シミュレーションと実世界の両方のアプリケーションのサンプル外テストによって実証される。
南アメリカ上空の広範囲な電離圏嵐データセットのモデリングは、SBASの電離圏補正を計算する正確で信頼性の高い手段を示唆している。
論文 参考訳(メタデータ) (2026-07-25T03:24:04Z) - GroundControl: Anticipating Navigation Failures in Vision-Language Agents via Trajectory-Consistent Uncertainty Estimates [3.7267095596919053]
視覚言語ナビゲーションエージェントは、ベンチマークタスクで平均的な競合的な成功を達成するが、予測可能な軌道レベルのブレークダウンによって失敗が発生することが多い。
信頼性の高いデプロイメントには、即時的なアクションエントロピーのみを反映するのではなく、実行中に発生する障害のダイナミクスを予測する不確実性信号が必要である。
本稿では,各エピソードに集約された目標方向距離-ゴール間距離の統計的偏差として定義される軌道整合不確実性推定器であるemphGroundControlを紹介する。
論文 参考訳(メタデータ) (2026-06-18T16:56:20Z) - Invisible Manipulation Channels in AI-Assisted Financial Advisory: Implications for Market Integrity and Regulatory Design [2.061257001243159]
本稿では,LLM推論のサンプリング層で動作している目に見えない操作チャネルを実験的に検証する。
この推測段階の操作は統計的に検出が困難であることを示す。
リスクの高い金融AIシステムに対するQRNG認証を必須とする4つの規制改正を提案する。
論文 参考訳(メタデータ) (2026-06-15T02:27:42Z) - Agentic Uncertainty Quantification [76.94013626702183]
本稿では,言語化された不確実性をアクティブな双方向制御信号に変換する統合されたデュアルプロセスエージェントUQ(AUQ)フレームワークを提案する。
システム1(Uncertainty-Aware Memory, UAM)とシステム2(Uncertainty-Aware Reflection, UAR)は、これらの説明を合理的な手段として利用し、必要な時にのみターゲットの推論時間解決をトリガーする。
論文 参考訳(メタデータ) (2026-01-22T07:16:26Z) - Preliminary Investigation into Uncertainty-Aware Attack Stage Classification [81.28215542218724]
この研究は、不確実性の下での攻撃段階推論の問題に対処する。
Evidential Deep Learning (EDL) に基づく分類手法を提案し、ディリクレ分布のパラメータを可能な段階に出力することで予測の不確実性をモデル化する。
シミュレーション環境における予備実験により,提案モデルが精度良く攻撃の段階を推定できることが実証された。
論文 参考訳(メタデータ) (2025-08-01T06:58:00Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - WATCH: Adaptive Monitoring for AI Deployments via Weighted-Conformal Martingales [22.789611187514975]
非パラメトリックシーケンシャルテストのメソッド -- 特にコンフォーマルテストマーチンチャル(CTM)と任意の時間価推論 -- は、この監視タスクに有望なツールを提供する。
既存のアプローチは、限られた仮説クラスやアラーム基準の監視に限られています。」
論文 参考訳(メタデータ) (2025-05-07T17:53:47Z) - Risks of ignoring uncertainty propagation in AI-augmented security pipelines [5.692289204193087]
AI技術の使用は、ソフトウェアベースのシステムのセキュアな開発に統合されている。
パイプライン内のエラーの伝播を考慮すると、AIが拡張したシステムの不確実性を推定する以前の研究はない。
本研究では,不確かさの伝播を把握し,不確かさを定量化するためのシミュレータを開発し,一事例スタディにより伝播誤差のシミュレーションを評価する。
論文 参考訳(メタデータ) (2024-07-14T19:02:20Z) - PreGAN: Preemptive Migration Prediction Network for Proactive
Fault-Tolerant Edge Computing [12.215537834860699]
本稿では,GAN(Generative Adrial Network)を用いた複合AIモデルPreGANを提案する。
PreGANは、欠陥検出、診断、分類において最先端のベースライン手法より優れており、高い品質のサービスを実現することができる。
論文 参考訳(メタデータ) (2021-12-04T09:40:50Z) - Heterogeneous-Agent Trajectory Forecasting Incorporating Class
Uncertainty [54.88405167739227]
本稿では,エージェントのクラス確率を明示的に組み込んだヘテロジニアスエージェント軌道予測手法であるHAICUを提案する。
さらに,新たな挑戦的な実世界の自動運転データセットであるpupも紹介する。
軌道予測にクラス確率を組み込むことで,不確実性に直面した性能が著しく向上することを示す。
論文 参考訳(メタデータ) (2021-04-26T10:28:34Z) - Distribution-free uncertainty quantification for classification under
label shift [105.27463615756733]
2つの経路による分類問題に対する不確実性定量化(UQ)に焦点を当てる。
まず、ラベルシフトはカバレッジとキャリブレーションの低下を示すことでuqを損なうと論じる。
これらの手法を, 理論上, 分散性のない枠組みで検討し, その優れた実用性を示す。
論文 参考訳(メタデータ) (2021-03-04T20:51:03Z) - Evaluating probabilistic classifiers: Reliability diagrams and score
decompositions revisited [68.8204255655161]
確率的に統計的に一貫性があり、最適に結合し、再現可能な信頼性図を自動生成するCORP手法を導入する。
コーパスは非パラメトリックアイソトニック回帰に基づいており、プール・アジャセント・ヴァイオレータ(PAV)アルゴリズムによって実装されている。
論文 参考訳(メタデータ) (2020-08-07T08:22:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。