論文の概要: Contextual Information Policy Optimization for Search Agents
- arxiv url: http://arxiv.org/abs/2608.06128v1
- Date: Thu, 06 Aug 2026 15:01:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.937721
- Title: Contextual Information Policy Optimization for Search Agents
- Title(参考訳): 検索エージェントの文脈情報ポリシー最適化
- Authors: Xingyu Guo, Wei Chen, Linlin Yang, Baochang Zhang,
- Abstract要約: 本稿では,エビデンス指向の強化学習フレームワークであるコンテキスト情報ポリシー最適化(CIPO)を提案する。
CIPOは、取得した情報に影響されたアクオクションの推論にターンレベルクレジットを割り当てる。
このエビデンス利用信号とグローバルな成果報酬を組み合わさって、前向きな正当性を与えます。
- 参考スコア(独自算出の注目度): 25.589979477350095
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Search agents extend large language models beyond static parametric memory by enabling them to acquire and use ex ternal evidence during multi-step reasoning. For knowledge intensive tasks involving complex or evolving information, their reliability depends not only on retrieving relevant ev idence but also on using it to guide subsequent reasoning. However, existing methods primarily reward final-answer cor rectness or intermediate progress, without directly assessing whether post-retrieval actions are grounded in the retrieved evidence. This misalignment encourages prior-driven reason ing: agents form conclusions based on internal knowledge and use retrieval mainly to confirm them, resulting in confirma tion bias and inefficient evidenceuse.Toaddressthisissue, we propose Contextual Information Policy Optimization (CIPO), an evidence-oriented reinforcement learning framework that explicitly aligns policy optimization with external evidence use. CIPO assigns dense, turn-level credit to reasoning ac tions influenced by retrieved information, while combining this evidence-use signal with a global outcome reward to pre serveanswercorrectness.Withthismanner,CIPOdiscourages evidence-detached guesses and promotes reasoning trajecto ries in which retrieved facts can guide or revise subsequent reasoning. Importantly, CIPO requires neither human process annotations nor an additional reward model. Extensive exper iments on seven in-domain and out-of-domain benchmarks show that CIPO reduces the prevalence of prior-driven rea soning and achieves excellent performance on most tasks.
- Abstract(参考訳): 検索エージェントは、静的パラメトリックメモリを超えて大きな言語モデルを拡張し、複数のステップの推論において、外部の3段階の証拠を取得および使用できるようにする。
複雑な情報や進化する情報を含む知識集約的なタスクでは、その信頼性は、関連するev idenceを検索するだけでなく、その後の推論をガイドするためにそれを使用することにも依存する。
しかし、既存の手法では、検索後の行動が証拠に根拠があるかどうかを直接評価することなく、主に最終回答正当性または中間進行性に報いる。
本ミスアライメントは, エージェントが内部知識に基づいて結論を定式化し, 主にそれを確認し, その結果, 判断バイアスと非効率なエビデンスを確証し, 今後の課題として, 政策最適化と外部エビデンスの使用を明確に整合させるエビデンス指向強化学習フレームワークである文脈情報政策最適化(CIPO)を提案する。
CIPOは、検索された情報に影響されたアクオクションの推論に高密度のターンレベルクレジットを割り当て、このエビデンス利用信号とグローバルなアウトカム報酬を前事の正当性(pre serveanswerrectness)に組み合わせ、CIPOdiscourages evidence-detached guessesを扱い、検索された事実がその後の推論を導いたり、修正したりできる推論のトラジェクトリーを促進する。
重要なことは、CIPOは人間のプロセスアノテーションも追加の報酬モデルも必要としない。
ドメイン内7つのベンチマークとドメイン外7つのベンチマークの大規模なエクスペラメントは、CIPOが事前駆動のreaソナリングの頻度を減らし、ほとんどのタスクで優れたパフォーマンスを実現していることを示している。
関連論文リスト
- RRCM: Ranking-Driven Retrieval over Collaborative and Meta Memories for LLM Recommendation [14.301653810918713]
大規模言語モデル(LLM)は、次世代のレコメンデーションシステムにとって有望なパラダイムとして登場した。
LLMに基づくエージェントレコメンデーションのためのランキング駆動型検索・推論フレームワークRRCMを提案する。
論文 参考訳(メタデータ) (2026-05-08T02:07:30Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Multi-Sourced, Multi-Agent Evidence Retrieval for Fact-Checking [47.47518672198846]
インターネット上に拡散する誤報は、社会と個人の両方に重大な脅威をもたらす。
これまでの方法は、トレーニングデータから学んだ意味的パターンと社会的コンテキスト的パターンに依存していた。
我々は、証拠のコアリソースとして認証されたオープンナレッジグラフを利用するWKGFCを提案する。
論文 参考訳(メタデータ) (2026-02-27T19:29:01Z) - Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward [24.738836592075927]
本稿では, セマンティック情報獲得報酬による効果的な情報探索を動機付ける統合フレームワークを提案する。
7つの質問回答ベンチマークでの実験では、InfoReasonerは強力な検索強化ベースラインを一貫して上回っている。
我々の研究は、理論的に基礎を置き、検索を伴うエージェント推論へのスケーラブルな道を提供する。
論文 参考訳(メタデータ) (2026-01-31T18:15:50Z) - Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards [60.0970117192627]
強化学習(Reinforcement Learning, RL)は, LLMに基づくディープサーチエージェントの強化に重要な手法である。
既存のアプローチは主にバイナリ結果の報酬に依存しており、エージェントの推論プロセスの包括性と事実性を捉えていない。
ディープサーチエージェントのための微粒化報酬フレームワークである textbfCitation-aware RL Rewards (CaRR) を提案する。
論文 参考訳(メタデータ) (2026-01-09T18:57:53Z) - PoU: Proof-of-Use to Counter Tool-Call Hacking in DeepResearch Agents [24.502121097996294]
Retrieval-augmented Generation (RAG) エージェントは、外部ツールを通じて、自律的な情報検索機能を備えた大規模言語モデルを拡張する。
以前見過ごされた障害モードであるTool-Call Hacking(ツールコールハッキング)を識別します。
提案するProof-of-Use(PoU)フレームワークは,検索された証拠,推論トレース,最終回答間の因果関係の検証を行う。
論文 参考訳(メタデータ) (2025-10-13T02:45:37Z) - ClueAnchor: Clue-Anchored Knowledge Reasoning Exploration and Optimization for Retrieval-Augmented Generation [82.54090885503287]
Retrieval-Augmented Generationは、外部知識を持つ大規模言語モデルを拡張して、事実性を改善する。
既存のRAGシステムは、忠実で解釈可能な推論をサポートするために必要な重要な手がかりを抽出して統合することができない。
本稿では,手掛かり付き推論探索と最適化によるRAG向上のための新しいフレームワークであるClueAnchorを提案する。
論文 参考訳(メタデータ) (2025-05-30T09:18:08Z) - From Relevance to Utility: Evidence Retrieval with Feedback for Fact Verification [118.03466985807331]
我々は、FVの関連性よりも、クレーム検証者が取得した証拠から導出する実用性に焦点を当てる必要があると論じる。
本稿では,エビデンス検索プロセスの最適化に,クレーム検証器からのフィードバックを取り入れたフィードバックベースのエビデンス検索手法(FER)を提案する。
論文 参考訳(メタデータ) (2023-10-18T02:59:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。