論文の概要: HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents
- arxiv url: http://arxiv.org/abs/2608.02009v2
- Date: Tue, 04 Aug 2026 23:06:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 17:51:08.551231
- Title: HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents
- Title(参考訳): HALT:検索エージェントの検証対応停止
- Abstract要約: 必要な証拠が現れた後、さらなる検索により、有用な情報ではなく、コスト、レイテンシ、コンテキストの混乱が増す。
我々は、発電機の信頼性よりもエビデンスカバレッジとして停止し、検索エージェントをそのままにしておく軽量な検証対応ポリシーであるHALTを導入する。
3つのマルチホップQAベンチマークで、HALTは冗長な検索を減らし、正確な一致を保っている。
- 参考スコア(独自算出の注目度): 0.7161783472741748
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented search agents answer multi-hop questions by repeatedly issuing search queries and accumulating evidence. This creates a stopping problem: after the necessary evidence has appeared, further retrieval often adds cost, latency, and distracting context rather than useful information. We frame stopping as evidence coverage rather than generator confidence, and introduce HALT, a lightweight verification-aware policy that leaves the search agent unchanged. Given expected hop claims, HALT stops only when cumulative evidence supports each required claim. Across three multi-hop QA benchmarks, HALT reduces redundant search while largely preserving exact match. We separate a deployable setting, where hop claims are generated from the question, from a diagnostic upper bound that uses gold supporting-fact annotations: generated claims give smaller but still exact-match-preserving savings, while gold claims show the larger savings available when hop targets are clean. Baseline comparisons and ablations show that this behavior is driven by claim-evidence alignment rather than generic sufficiency, fixed stop positions, or lexical overlap. Open-corpus pilots further suggest that HALT abstains when coverage cannot be reliably verified. Overall, evidence coverage provides a practical runtime control signal for improving retrieval-augmented agents without retraining or modifying the host agent.
- Abstract(参考訳): Retrieval-augmented search agentは、検索クエリを繰り返し発行し、エビデンスを蓄積することで、マルチホップの質問に答える。
必要なエビデンスが現れた後、さらなる検索は、有用な情報ではなく、コスト、レイテンシ、コンテキストの混乱を伴います。
我々は、発電機の信頼性よりもエビデンスカバレッジとして停止し、検索エージェントをそのまま残す軽量な検証対応ポリシーであるHALTを導入する。
期待されたホップクレームを考えると、HALTは要求された各クレームを累積的証拠がサポートする場合にのみ停止する。
3つのマルチホップQAベンチマークで、HALTは冗長な検索を減らし、正確な一致を保っている。
我々は、ホップのクレームが問題から生成されるデプロイ可能な設定を、ゴールドサポートファクトアノテーションを使用する診断上のバウンドから分離する:生成されたクレームは、小さいが、正確なマッチ保存のセーブを与え、一方、金のクレームはホップターゲットがクリーンであるときに利用できるより大きなセーブを示す。
ベースライン比較とアブレーションにより、この挙動は一般的な充足、固定された停止位置、または語彙上の重複よりも、クレーム-エビデンスアライメントによって引き起こされることが示された。
オープンコーパスのパイロットは、HALTが適用範囲を確実に検証できない場合に停止することを示唆している。
全体として、エビデンスカバレッジは、ホストエージェントをリトレーニングしたり修正したりすることなく、検索強化エージェントを改善するための実用的なランタイム制御信号を提供する。
関連論文リスト
- Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents [63.2133766267587]
ディープサーチエージェントは、証拠収集のために検索クエリを反復的に発行することで、難解な情報検索質問に答える。
本研究では,長軸探索エージェントの軌跡レベル診断を用いてこれらの質問について検討する。
我々は,各探索ステップで得られた証拠を評価し,エージェントの行動の2つの段階を分離する。
論文 参考訳(メタデータ) (2026-08-03T08:46:48Z) - Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection [13.409515289348532]
VulAgentRLは、コードプロパティグラフ(CPG)上に構築された、相互の脆弱性検出のためのフレームワークである。
VulAgentRLは、フロンティアモデルを含む最先端のベースラインを厳密なペアワイズ補正基準で上回り、より少ないツールコールを発行する。
論文 参考訳(メタデータ) (2026-07-29T09:16:54Z) - AREX: Towards a Recursively Self-Improving Agent for Deep Research [75.96468303743958]
本稿では,再帰的自己改善型ディープリサーチエージェントであるAREXを紹介する。
AREXは、証拠を集め、暫定的な回答を構築する内部研究ループを交互に構成する。
我々は,エージェント学習と長期強化学習を通じて,AREXを検証済みの合成タスクと高品質な軌道上で訓練する。
論文 参考訳(メタデータ) (2026-07-23T16:05:46Z) - DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - Affordance Agent Harness: Verification-Gated Skill Orchestration [45.231685718099264]
Affordance groundingは、オープンワールドのシーンでエージェントがどこでどのように対話すべきかを特定する必要がある。
本稿では,エビデンスストアとコストコントロールを備えたクローズドループランタイムであるAffordance Agent Harnessを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:45:16Z) - All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution [20.68235182577703]
All-Memは明示的で非破壊的な統合を通じて構造化されたメモリバンクを維持している。
LLM診断器は定期的にオフラインで、SPLIT、MERGE、UPDATEの3つの演算子で実行される信頼性スコアトポロジ編集を提案する。
クエリ時には、タイプドリンクはホップバウンドで、アクティブアンカーから必要に応じてアーカイブされたエビデンスへの予算付き拡張を可能にする。
論文 参考訳(メタデータ) (2026-03-20T03:14:40Z) - SE-Search: Self-Evolving Search Agent via Memory and Dense Reward [87.79131676521656]
Retrieval augmented generation (RAG)は、検索した外部知識を条件づけることにより、大規模言語モデル(LLM)における幻覚や事実エラーを低減する。
既存の手法は、無関係または騒々しい文書を蓄積し、希少な強化学習信号に依存することが多い。
我々は,3つのコンポーネントによるオンライン検索行動を改善するセルフ進化検索エージェントであるtextbfSelf-textbfEvolving textbfSearchを提案する。
論文 参考訳(メタデータ) (2026-02-06T09:14:07Z) - FIRE: Fact-checking with Iterative Retrieval and Verification [63.67320352038525]
FIREはエビデンス検索とクレーム検証を反復的に統合する新しいフレームワークである。
大きな言語モデル(LLM)のコストを平均7.6倍、検索コストを16.5倍削減しながら、パフォーマンスが若干向上している。
これらの結果から,FIREは大規模ファクトチェック業務における適用を約束していることが明らかとなった。
論文 参考訳(メタデータ) (2024-10-17T06:44:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。