論文の概要: PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent
- arxiv url: http://arxiv.org/abs/2608.00969v1
- Date: Sun, 02 Aug 2026 03:48:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.039257
- Title: PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent
- Title(参考訳): プログレス: サーチ強化LDMエージェントを訓練するためのカバーガイド付きRL
- Authors: Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Aounon Kumar, Yashas Malur Saidutta, Wenbo Li, Srinivas Chappidi,
- Abstract要約: 既存のLLMエージェントは強化学習を使用して学習し、推論能力を向上させる。
本稿では,教師が指導するカバレッジ報酬を利用して,分解されたクエリ生成を明示的に形作るPROGRESSを提案する。
このアプローチはR1スタイルのトレーニングフレームワークに統合され、クエリの分解決定に関する軽量なガイダンスを提供します。
- 参考スコア(独自算出の注目度): 16.60550424408283
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing search-augmented LLM agents are trained using Reinforcement Learning to boost its reasoning capabilities. However, these approaches primarily rely on outcome-level rewards, which provide little supervision over search behavior and overlook agent's ability to decompose complex queries properly. To mitigate this issue, we propose PROGRESS which utilizes teacher-guided coverage reward to explicitly shape decomposed query generation of the policy model. During training, frozen teacher models are used to decompose complex queries into essential search queries. These essential search queries are utilized to guide the search behavior of the policy model. Integrated into an R1-style training framework, our approach provides lightweight guidance over query decomposition decisions without dense process-level supervision. Experiments show that coverage-guided RL improves overall task performance, highlighting the importance of explicitly supervising search strategies in agentic LLMs.
- Abstract(参考訳): 既存のLLMエージェントは強化学習を使用して学習し、推論能力を向上させる。
しかし、これらのアプローチは主に結果レベルの報酬に依存しており、検索行動の監督や複雑なクエリを適切に分解する見落としエージェントの能力はほとんど提供されない。
この問題を軽減するために,教師誘導型カバレッジ報酬を利用してポリシーモデルの分解クエリ生成を明示的に形成するproGRESSを提案する。
訓練中、凍結した教師モデルは複雑なクエリを必須の検索クエリに分解するために使用される。
これらの本質的な探索クエリは、ポリシーモデルの探索行動を導くために利用される。
提案手法は,R1スタイルのトレーニングフレームワークに統合され,厳密なプロセスレベルの監視を伴わずに,クエリ分解決定に対する軽量なガイダンスを提供する。
実験により、カバー範囲誘導RLは全体のタスク性能を向上し、エージェントLLMにおける探索戦略を明示的に監督することの重要性を強調した。
関連論文リスト
- APEX-Searcher: Augmenting LLMs' Search Capabilities through Agentic Planning and Execution [10.643859464982071]
APEX-Searcherは、大規模言語モデル(LLM)検索能力を増強する新しいエージェントプランニングおよび実行フレームワークである。
戦略計画の最適化のために、まずRLを分解特異的な報酬として採用する。
その後、高品質なマルチホップ軌道の教師付き微調整を適用し、ロバストな反復的なサブタスク実行能力を持つモデルに装備する。
論文 参考訳(メタデータ) (2026-03-14T09:17:12Z) - Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards [60.0970117192627]
強化学習(Reinforcement Learning, RL)は, LLMに基づくディープサーチエージェントの強化に重要な手法である。
既存のアプローチは主にバイナリ結果の報酬に依存しており、エージェントの推論プロセスの包括性と事実性を捉えていない。
ディープサーチエージェントのための微粒化報酬フレームワークである textbfCitation-aware RL Rewards (CaRR) を提案する。
論文 参考訳(メタデータ) (2026-01-09T18:57:53Z) - Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search [70.63903518295785]
モンテカルロ木探索によるエージェント強化学習フレームワークRepoSearch-R1を紹介する。
RepoSearch-R1に基づいて,リポジトリ質問応答タスク用に設計されたRepoQA-Agentを構築する。
論文 参考訳(メタデータ) (2025-10-30T09:10:36Z) - RE-Searcher: Robust Agentic Search with Goal-oriented Planning and Self-reflection [55.125987985864896]
環境の複雑さが脆弱な探索行動をいかに引き起こすかを定量的に分析する。
本稿では,検索エージェントRE-Searcherのインスタンス化をシンプルかつ効果的に行う手法を提案する。
この目標指向計画と自己回帰の組み合わせにより、RE-Searcherは複雑な検索環境における急激な手がかりに抵抗することができる。
論文 参考訳(メタデータ) (2025-09-30T10:25:27Z) - An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents [34.25887147052966]
強化学習(RL)は、現実世界の問題解決に複雑な推論が可能な大規模言語モデル(LLM)の訓練に強い可能性を示している。
最近では、RLを利用して、推論と検索エンジンの使用を巧みに組み合わせた高度なLLMベースの検索エージェントが作成されている。
1)報酬の定式化,(2)基礎となるLLMの選択と特性,(3)RLプロセスにおける検索エンジンの役割など,重要な要素はさらなる調査が必要である。
論文 参考訳(メタデータ) (2025-05-21T05:09:43Z) - SEM: Reinforcement Learning for Search-Efficient Large Language Models [26.075903427834838]
大きな言語モデル(LLM)は、推論だけでなく、外部ツールの呼び出しでもその能力を実証している。
既存の強化学習アプローチは、しばしば冗長な探索行動を引き起こす。
本研究では,学習後強化学習フレームワークであるSEMを提案する。
論文 参考訳(メタデータ) (2025-05-12T09:45:40Z) - R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning [87.30285670315334]
textbfR1-Searcherは、大規模言語モデルの検索能力を高めるために設計された、2段階の結果に基づく新しいRLアプローチである。
本フレームワークは, コールドスタート時に, プロセス報酬や蒸留を必要とせず, RLのみに依存している。
提案手法は, クローズドソースGPT-4o-miniと比較して, 従来の強力なRAG法よりも有意に優れていた。
論文 参考訳(メタデータ) (2025-03-07T17:14:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。