論文の概要: BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent
- arxiv url: http://arxiv.org/abs/2608.01321v1
- Date: Sun, 02 Aug 2026 15:41:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.164059
- Title: BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent
- Title(参考訳): BiCAA: 検索強化エージェントの双方向クレジットアサインメント
- Authors: Yibin Huang, Bin Xu, Hailong Cao, Conghui Zhu,
- Abstract要約: BiCAAは、前向きの可解性向上と後続の成功臨界という2つの相補的なシグナルを融合することによって、双方向のプロセス報酬を構築する。
検索強化されたQAベンチマークの実験では、BiCAAはポリシー最適化を安定化し、冗長な探索動作を低減し、競争性能を達成する。
- 参考スコア(独自算出の注目度): 7.0011576165695
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-step search is a fundamental capability for search agents, enabling them to iteratively acquire, refine, and integrate external evidence for complex reasoning QA. However, vanilla GRPO allocates rewards exclusively based on the model's final outputs, yielding outcome-only supervision with no supervisory signals for intermediate reasoning steps. Such sparse supervision easily causes training instability and redundant search behaviors on multi-step search tasks. To mitigate this limitation, we adopt process reward to deliver stepwise supervision signals. For this process reward, we propose two complementary criteria to judge each search step: whether the step yields new evidence to facilitate problem solving, and whether it forms an efficient, pivotal intermediate decision within the overall reasoning trajectory. Building on this insight, we propose BiCAA: a bidirectional credit assignment framework that delivers dense, distinguishing process rewards for search-augmented agents. BiCAA builds bidirectional process rewards by fusing two complementary signals: forward solvability gain and hindsight success criticality. The former quantifies step-wise improvements in answer plausibility, while the latter evaluates each step's necessity for final success via hindsight outcome-based criticality scoring. We modulate and aggregate the two signals and then fuse them with the outcome reward. Experiments on search-augmented QA benchmarks show that BiCAA stabilizes policy optimization, reduces redundant search behavior, and achieves competitive performance.
- Abstract(参考訳): 多段階探索は検索エージェントにとって基本的な機能であり、複雑な推論QAのための外部証拠を反復的に取得、精査、統合することができる。
しかしながら、バニラGRPOはモデルの最終出力のみに基づいて報酬を割り当て、中間推論ステップの監視信号なしで結果のみを監督する。
このような疎度な監視は、多段階探索タスクにおけるトレーニング不安定性と冗長な探索動作を容易に引き起こす。
この制限を緩和するため、工程報酬を採用し、段階的に監視信号を提供する。
本プロセスの報奨として,各探索ステップを判断するための2つの補完的基準を提案する。
そこで本研究では, BiCAAを提案する。 BiCAAは, 検索対象エージェントに対して, プロセス報酬を高密度に識別する双方向の信用割当フレームワークである。
BiCAAは、前向きの可解性向上と後続の成功臨界という2つの相補的なシグナルを融合することによって、双方向のプロセス報酬を構築する。
前者は解答確率のステップワイズ改善を定量化し、後者は後続結果に基づく臨界スコアによる最終成功のための各ステップの必要性を評価する。
2つのシグナルを変調して集約し、結果の報酬でそれらを融合します。
検索強化されたQAベンチマークの実験では、BiCAAはポリシー最適化を安定化し、冗長な探索動作を低減し、競争性能を達成する。
関連論文リスト
- CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search [51.911048955965136]
CoSearchは多段階推論エージェントと生成ドキュメントランキングモデルを共同でトレーニングするフレームワークである。
この結果から, 推論エージェントと検索システムの協調訓練は, 実現可能であり, 性能も高いことが示唆された。
論文 参考訳(メタデータ) (2026-04-19T17:48:17Z) - AgentV-RL: Scaling Reward Modeling with Agentic Verifier [63.55502685076245]
試験時間スケーリング(TTS)によるLCM推論を強化する検証器が実証されている。
本稿では,報酬モデリングを多ターンツール拡張型検討プロセスに変換するフレームワークであるエージェント検証を提案する。
Agentic Verifier は並列およびシーケンシャルTS の両方で一貫した性能向上が得られることを示す。
論文 参考訳(メタデータ) (2026-04-17T12:27:36Z) - Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning [32.295907409325615]
強化学習による検索エンジンの推論のための大規模言語モデルの訓練は、信用代行問題によって妨げられる。
2つの相補的なアイデアに基づいて構築されたフレームワークであるSLATEを提案する。
7つのQAベンチマークの実験では、SLATEがスパース・リワードとプロセス・リワードのベースラインを一貫して上回っていることが確認された。
論文 参考訳(メタデータ) (2026-02-26T19:05:40Z) - Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration [49.9937230730202]
本稿では,新たなアクター・リファイナ・コラボレーション・フレームワークであるSearch-R2を提案する。
提案手法は,生成過程をアクターに分解し,最初の推論軌道を生成する。
本稿では,検索-R2がモデルスケール全体にわたって強力なRAGとRLベースのベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-03T15:32:09Z) - Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning [137.33138614095435]
Retrieval-augmented Generation (RAG) は、大規模言語モデルにおける幻覚の緩和に有効であることが証明されている。
近年、検索に基づく対話をRAGに組み込んで、リアルタイム検索による反復推論を可能にしている。
提案するBi-RARは,各中間ステップを前方方向と後方方向の両方で共同で評価する,新たな検索拡張推論フレームワークである。
論文 参考訳(メタデータ) (2025-11-12T08:29:39Z) - Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents [19.31471304268234]
DeSA(Decoupling Search-and-Answering)は,検索最適化と回答生成を明確に分離する単純な2段階トレーニングフレームワークである。
7つのQAベンチマークで、DeSAがトレーニングしたエージェントは検索の振る舞いを継続的に改善し、結果のみのベースラインよりも検索リコールと回答の精度が大幅に向上した。
論文 参考訳(メタデータ) (2025-10-06T11:09:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。