論文の概要: Before Reasoning Can Fail: Pre-Evidence Procedural Failures in Agentic RAG
- arxiv url: http://arxiv.org/abs/2608.02011v2
- Date: Tue, 04 Aug 2026 14:04:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.432825
- Title: Before Reasoning Can Fail: Pre-Evidence Procedural Failures in Agentic RAG
- Title(参考訳): 推論が失敗する前:エージェントRAGにおける手続き的失敗の証拠
- Authors: Daeyoung Roh, Donghee Han,
- Abstract要約: エージェント検索拡張生成(RAG)システムは、エビデンス条件の推論がテストされる前に失敗する可能性がある。
我々は,この故障モードをエージェント軌道の手続き的特性として検討する。
ReadGateは,検索後およびファイナライゼーション前において,エージェントが読み取る必要のある最小限のランタイムである。
- 参考スコア(独自算出の注目度): 0.7161783472741748
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic retrieval-augmented generation (RAG) systems can fail before evidence-conditioned reasoning is tested: an agent may retrieve candidate snippets but finalize without inspecting them. We study this failure mode as a procedural property of the agent trajectory, decomposing wrong answers into pre-evidence discipline failures and post-gold-read failures using saved tool-call traces, retrieved evidence, read passages, and final answers. Across 12,000 paired trajectories on HotpotQA, 2WikiMultiHopQA, and MuSiQue, the two failure types are largely non-redundant: the both-trigger rate is in [11.2%, 13.1%] across regex and spaCy entity extractors. We then evaluate Read-Gate, a minimal runtime invariant requiring an agent to read after search and before finalization. Forced reading improves LLM-Acc by 14.9-19.9 points on trajectories that would otherwise skip reading and by 3.2-9.4 points on full minimal-reasoning cells. Additional diagnostics show that larger hidden thinking budgets do not necessarily increase evidence inspection. Together, these results indicate that evidence-gathering should be evaluated as a trajectory-level control problem, separately from answer-side reasoning.
- Abstract(参考訳): エージェント検索強化世代(RAG)システムは、証拠条件付き推論がテストされる前に失敗する可能性がある:エージェントは候補のスニペットを検索するが、検査せずにファイナライズする。
我々は,この障害モードをエージェント軌跡の手続き的特性として検討し,誤った解答を事前証明の規律的失敗と,保存されたツールコールトレース,証拠の検索,読み出し,最終解答に分解する。
HotpotQA, 2WikiMultiHopQA, MuSiQue上の12,000のペアのトラジェクトリのうち、2つの障害タイプはほぼ非冗長である。
次に、検索とファイナライゼーションの前に、エージェントが読み取る必要のある最小限のランタイム不変量であるRead-Gateを評価する。
強制読影はLLM-Accを14.9-19.9ポイント改善し、それ以外は読影をスキップするトラジェクトリを3.2-9.4ポイント改善する。
さらなる診断は、大きな隠れ思考予算が必ずしも証拠検査を増加させるとは限らないことを示している。
これらの結果から,エビデンス収集は,回答側推論とは別に,軌道レベルの制御問題として評価されるべきであることが示唆された。
関連論文リスト
- When Collaboration Becomes a Trigger: Collective Evidence-Threshold Backdoors in Multi-Agent Systems [57.450132281381066]
ピアエビデンスが単一のメッセージによって決定されるのではなく、隠れたしきい値に達すると、バックドアの動作が起動される。
我々は,MASとBundary-Conditioned Backdoor Injection(BCBI)のための集合的エビデンス-ホールドバックドアパラダイムを導入する。
クリーンな通信力学を学習し,異常なエージェント更新を隔離する,クリーンな唯一の潜時防御であるLATTEを提案する。
論文 参考訳(メタデータ) (2026-08-02T08:38:44Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion [0.0]
検証可能な報酬(RLVR)を用いた強化学習は、繰り返しサンプリング時にモデルを悪化させながら、一サンプル精度を向上させることができる。
トレーニング後、このポリシーはベースモデルよりも小さな問題を、大きな$k$で解決する可能性がある。
失敗は境界プロンプトに集中しており、ベースモデルにはサンプリングによって回復できる稀な正しい軌道が含まれており、有限のRLVRロールアウトグループに確実に現れるには小さすぎる。
論文 参考訳(メタデータ) (2026-07-12T17:17:18Z) - When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories [20.332123003765837]
早期の障害警告では、ダイアログやエージェントのトラジェクトリがまだ展開されている間に、フェールするかどうかを判断する必要がある。
一般的には、トラジェクトリレベルの成功/失敗ラベルとしてのみ、監視が利用可能であるのに対して、アラートは部分的なインタラクションから引き上げなければならないため、これは難しい。
本稿では、このスパースエビデンス構造から学習し、その結果のリスク推定を制御可能な早期警報に利用する2段階のアプローチを提案する。
論文 参考訳(メタデータ) (2026-06-03T20:28:27Z) - ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time Scaling [57.42714978834704]
ExCommは、探索段階のエージェントテストタイムスケーリングのための通信プロトコルである。
ExCommは、強いテスト時間スケーリングベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-21T07:38:44Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - Affordance Agent Harness: Verification-Gated Skill Orchestration [45.231685718099264]
Affordance groundingは、オープンワールドのシーンでエージェントがどこでどのように対話すべきかを特定する必要がある。
本稿では,エビデンスストアとコストコントロールを備えたクローズドループランタイムであるAffordance Agent Harnessを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:45:16Z) - AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing [9.271196825503417]
大きな言語モデル(LLM)は、脆弱性検出にますます採用されているが、その推論は基本的には正しくない。
AEGISは、未解決の投機から、クローズドな事実ベース上の法医学的検証へ、検出をシフトする新しいマルチエージェントフレームワークである。
これは、主要なベースラインと比較して偽陽性率を最大54.40%削減し、1サンプルあたりの平均コストはタスク固有のトレーニングなしで0.09ドルである。
論文 参考訳(メタデータ) (2026-03-21T04:12:04Z) - Thinking Traps in Long Chain-of-Thought: A Measurable Study and Trap-Aware Adaptive Restart [27.904791075662896]
TAAR(Trap-Aware Adaptive Restart)は,部分軌道から2つの信号を予測するための診断ポリシーをトレーニングするテスト時間制御フレームワークである。
推測時、TAARは予測されたトラップセグメントの前に軌道を切断し、復号を適応的に再起動する。
実験の結果,TAARはモデルパラメータを微調整することなく推論性能を向上させることがわかった。
論文 参考訳(メタデータ) (2026-01-17T07:26:02Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。