論文の概要: Contextual Information Policy Optimization for Search Agents
- arxiv url: http://arxiv.org/abs/2608.06128v3
- Date: Tue, 11 Aug 2026 02:08:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.731297
- Title: Contextual Information Policy Optimization for Search Agents
- Title(参考訳): 検索エージェントの文脈情報ポリシー最適化
- Abstract要約: 我々は,政策最適化と外部エビデンス利用の整合を図るために,文脈情報政策最適化(CIPO)を提案する。
CIPOは、検索された情報に影響された推論行動にターンレベルクレジットを割り当て、このエビデンス利用信号とグローバルな結果報酬を組み合わせて、回答の正当性を維持する。
実験によると、CIPOは事前駆動推論の頻度を減らし、ほとんどのタスクにおいて優れたパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 25.589979477350095
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Search agents extend large language models beyond static parametric memory by enabling them to acquire and use external evidence during multi-step reasoning. For knowledge-intensive tasks involving complex or evolving information, their reliability depends not only on retrieving relevant evidence but also on using it to guide subsequent reasoning. However, existing methods primarily reward final-answer correctness or intermediate progress, without directly assessing whether post-retrieval actions are grounded in the retrieved evidence. This misalignment encourages prior-driven reasoning: agents form conclusions based on internal knowledge and use retrieval mainly to confirm them, resulting in confirmation bias and inefficient evidence use. To address this issue, we propose Contextual Information Policy Optimization (CIPO), an evidence-oriented reinforcement learning framework that explicitly aligns policy optimization with external evidence use. CIPO assigns dense, turn-level credit to reasoning actions influenced by retrieved information, while combining this evidence-use signal with a global outcome reward to preserve answer correctness. With this manner, CIPO discourages evidence-detached guesses and promotes reasoning trajectories in which retrieved facts can guide or revise subsequent reasoning. Importantly, CIPO requires neither human process annotations nor an additional reward model. Extensive experiments on seven in-domain and out-of-domain benchmarks show that CIPO reduces the prevalence of prior-driven reasoning and achieves excellent performance on most tasks.
- Abstract(参考訳): 検索エージェントは、静的パラメトリックメモリを超えて大きな言語モデルを拡張し、複数のステップの推論において外部の証拠を取得および使用できるようにする。
複雑な情報や進化する情報を含む知識集約的なタスクでは、それらの信頼性は、関連する証拠を検索するだけでなく、その後の推論を導くためにそれを使用することにも依存する。
しかし、既存の手法は、検索後の行動が証拠に根拠があるかどうかを直接評価することなく、主に最終回答正当性または中間進捗に報いる。
エージェントは内部知識に基づいて結論を定め、主にそれらを確認するために使用し、確認バイアスと非効率な証拠の使用をもたらす。
この問題に対処するために、我々は、ポリシー最適化と外部エビデンスの使用を明確に整合させるエビデンス指向の強化学習フレームワークであるコンテキスト情報政策最適化(CIPO)を提案する。
CIPOは、検索された情報に影響された推論行動に対して、密度の高いターンレベルクレジットを割り当て、このエビデンス利用信号とグローバルな結果報酬を組み合わせて、回答の正当性を維持する。
このようにして、CIPOは証拠を抽出した推測を排除し、検索された事実がその後の推論を導いたり、修正したりできる推論の軌跡を促進する。
重要なことは、CIPOは人間のプロセスアノテーションも追加の報酬モデルも必要としない。
7つのドメイン内および外部のベンチマークに関する大規模な実験は、CIPOが事前駆動推論の頻度を減らし、ほとんどのタスクで優れたパフォーマンスを達成することを示している。
関連論文リスト
- RRCM: Ranking-Driven Retrieval over Collaborative and Meta Memories for LLM Recommendation [14.301653810918713]
大規模言語モデル(LLM)は、次世代のレコメンデーションシステムにとって有望なパラダイムとして登場した。
LLMに基づくエージェントレコメンデーションのためのランキング駆動型検索・推論フレームワークRRCMを提案する。
論文 参考訳(メタデータ) (2026-05-08T02:07:30Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Multi-Sourced, Multi-Agent Evidence Retrieval for Fact-Checking [47.47518672198846]
インターネット上に拡散する誤報は、社会と個人の両方に重大な脅威をもたらす。
これまでの方法は、トレーニングデータから学んだ意味的パターンと社会的コンテキスト的パターンに依存していた。
我々は、証拠のコアリソースとして認証されたオープンナレッジグラフを利用するWKGFCを提案する。
論文 参考訳(メタデータ) (2026-02-27T19:29:01Z) - Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward [24.738836592075927]
本稿では, セマンティック情報獲得報酬による効果的な情報探索を動機付ける統合フレームワークを提案する。
7つの質問回答ベンチマークでの実験では、InfoReasonerは強力な検索強化ベースラインを一貫して上回っている。
我々の研究は、理論的に基礎を置き、検索を伴うエージェント推論へのスケーラブルな道を提供する。
論文 参考訳(メタデータ) (2026-01-31T18:15:50Z) - Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards [60.0970117192627]
強化学習(Reinforcement Learning, RL)は, LLMに基づくディープサーチエージェントの強化に重要な手法である。
既存のアプローチは主にバイナリ結果の報酬に依存しており、エージェントの推論プロセスの包括性と事実性を捉えていない。
ディープサーチエージェントのための微粒化報酬フレームワークである textbfCitation-aware RL Rewards (CaRR) を提案する。
論文 参考訳(メタデータ) (2026-01-09T18:57:53Z) - PoU: Proof-of-Use to Counter Tool-Call Hacking in DeepResearch Agents [24.502121097996294]
Retrieval-augmented Generation (RAG) エージェントは、外部ツールを通じて、自律的な情報検索機能を備えた大規模言語モデルを拡張する。
以前見過ごされた障害モードであるTool-Call Hacking(ツールコールハッキング)を識別します。
提案するProof-of-Use(PoU)フレームワークは,検索された証拠,推論トレース,最終回答間の因果関係の検証を行う。
論文 参考訳(メタデータ) (2025-10-13T02:45:37Z) - ClueAnchor: Clue-Anchored Knowledge Reasoning Exploration and Optimization for Retrieval-Augmented Generation [82.54090885503287]
Retrieval-Augmented Generationは、外部知識を持つ大規模言語モデルを拡張して、事実性を改善する。
既存のRAGシステムは、忠実で解釈可能な推論をサポートするために必要な重要な手がかりを抽出して統合することができない。
本稿では,手掛かり付き推論探索と最適化によるRAG向上のための新しいフレームワークであるClueAnchorを提案する。
論文 参考訳(メタデータ) (2025-05-30T09:18:08Z) - From Relevance to Utility: Evidence Retrieval with Feedback for Fact Verification [118.03466985807331]
我々は、FVの関連性よりも、クレーム検証者が取得した証拠から導出する実用性に焦点を当てる必要があると論じる。
本稿では,エビデンス検索プロセスの最適化に,クレーム検証器からのフィードバックを取り入れたフィードバックベースのエビデンス検索手法(FER)を提案する。
論文 参考訳(メタデータ) (2023-10-18T02:59:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。