論文の概要: SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering
- arxiv url: http://arxiv.org/abs/2606.00593v1
- Date: Sat, 30 May 2026 07:47:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.541295
- Title: SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering
- Title(参考訳): SPADER:多解答に対する多変量対応探索によるステップワイズピアアドバンテージ
- Abstract要約: 大規模言語モデルは、パラメトリック知識を超えた情報を取得するツール拡張エージェントとして、ますます多くデプロイされている。
マルチアンサーQAにおける長期ツール利用のための強化学習フレームワークであるSPADERを提案する。
SPADERは一般に、リコールとF1全体の改善を、プロンプトベースのエージェント、結果管理型RL手法、最近のステップレベルの監視手法よりも促進することを示す。
- 参考スコア(独自算出の注目度): 28.469701396085952
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly deployed as tool-augmented agents to acquire information beyond parametric knowledge. While recent work has improved long-horizon tool-use reasoning, most approaches focus on tasks with a single correct answer. In contrast, many real-world queries require discovering a comprehensive set of valid answers, a setting known as Multi-Answer QA. This setting raises two challenges: fine-grained credit assignment over long search trajectories and reward alignment for sustained exploration beyond easy high-frequency entities. We propose SPADER, a reinforcement learning framework for long-horizon tool use in Multi-Answer QA. SPADER includes Step-wise Peer Advantage (SPA), a critic-free step-level credit assignment mechanism that aligns parallel trajectories by decision step and estimates advantages from peer returns. It also includes a diversity-aware exploration reward that promotes long-tail entity discovery by upweighting rare findings and downweighting redundant ones. Experiments on QAMPARI, Mintaka, WebQSP, and QUEST show that SPADER generally improves recall and overall F1 over prompting-based agents, outcome-supervised RL methods, and recent step-level supervision approaches. Our code and model weights are available at https://github.com/KhanCold/spader.
- Abstract(参考訳): 大規模言語モデルは、パラメトリック知識を超えた情報を取得するツール拡張エージェントとして、ますます多くデプロイされている。
最近の研究は、長期的なツール使用推論を改善しているが、ほとんどのアプローチは、ひとつの正しい答えを持つタスクに焦点を当てている。
対照的に、現実世界のクエリの多くは、Multi-Answer QAとして知られる、有効な回答の集合を見つける必要がある。
この設定は、2つの課題を提起する: 長い探索軌跡に対するきめ細かい信用割当と、容易な高周波エンティティを超えた継続的な探索のための報酬アライメントである。
マルチアンサーQAにおける長期ツール利用のための強化学習フレームワークであるSPADERを提案する。
SPADERにはSPA(Step-wise Peer Advantage)が含まれており、これは批判のないステップレベルのクレジット割り当て機構で、決定ステップごとに並列なトラジェクトリを調整し、ピアリターンからのメリットを推定する。
また、希少な発見の重み付けと冗長な発見の重み付けによって、長い尾の実体の発見を促進する多様性を意識した探索報酬も含まれている。
QAMPARI、Mintaka、WebQSP、およびQUESTの実験では、SPADERは一般にリコールと全体的なF1を改善する。
コードとモデルの重み付けはhttps://github.com/KhanCold/spader.comで公開されています。
関連論文リスト
- GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning [27.83191719981676]
グラフトラジェクトリ拡張RLフレームワークであるtextscGTA-RAG について述べる。
メソッドは、Qwen2.5-3BとQwen2.5-7BのバックボーンでRLベースのRAGベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-23T16:05:20Z) - PRAISE: Prefix-Based Rollout Reuse in Agentic Search Training [28.912613644535668]
本稿では,エージェント検索訓練におけるデータ効率向上のためのフレームワークPRAISEを提案する。
本手法は,検索ポリシー学習とプレフィックス応答評価の両方に,単一の共有モデルを用いる。
マルチホップQAベンチマークの実験では、PRAISEは強いベースラインよりも一貫してパフォーマンスを改善している。
論文 参考訳(メタデータ) (2026-04-04T10:23:46Z) - Training Multi-Turn Search Agent via Contrastive Dynamic Branch Sampling [29.182538022605627]
Branching Relative Policy Optimization (BranPO) は、高額な報酬なしで段階レベルのコントラスト管理を提供する価値のない手法である。
BranPOは尾部付近の軌跡を切断し、他の連続をサンプリングし、共有接頭辞の上に対照的な接尾辞を構成する。
さらに効率を向上し、トレーニングを安定させるために、タスク間の分岐周波数に適応する難易度分岐サンプリングと、不正な動作を抑制するために冗長なステップマスキングを導入する。
論文 参考訳(メタデータ) (2026-02-03T16:43:09Z) - IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning [54.21689544323704]
Deep Research (DR)エージェントは、パラメトリック知識を超えてLarge Language Models (LLM)を拡張する。
リアルタイムの会話アシスタントとは異なり、DRは計算に高価で時間を要する。
IntentRLは、長期研究を始める前に、潜在ユーザ意図を明らかにするためにプロアクティブエージェントを訓練するフレームワークである。
論文 参考訳(メタデータ) (2026-02-03T12:43:09Z) - Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration [52.35887679314727]
長期記憶身体探索は、エージェントの探索的認知と意思決定行動を統合することを目的としている。
エージェントのメモリリコールとプロアクティブな探索能力を高めるため,我々はMemoryExplorerを提案する。
論文 参考訳(メタデータ) (2026-01-11T16:23:22Z) - Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning [137.33138614095435]
Retrieval-augmented Generation (RAG) は、大規模言語モデルにおける幻覚の緩和に有効であることが証明されている。
近年、検索に基づく対話をRAGに組み込んで、リアルタイム検索による反復推論を可能にしている。
提案するBi-RARは,各中間ステップを前方方向と後方方向の両方で共同で評価する,新たな検索拡張推論フレームワークである。
論文 参考訳(メタデータ) (2025-11-12T08:29:39Z) - Multi-Agent Craftax: Benchmarking Open-Ended Multi-Agent Reinforcement Learning at the Hyperscale [53.08403177911567]
textitCraftax-MAは、人気のあるオープンエンドRL環境であるCraftaxの拡張である。
textitCraftax-Coopは異質なエージェント、トレーディング、さらに多くのメカニクスを導入し、エージェント間の複雑な協力を必要としている。
論文 参考訳(メタデータ) (2025-11-07T01:09:36Z) - DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL [60.47878242100153]
我々は、ディープサーチエージェントを進化させるためにDeepDiveを提示する。
オープンな知識グラフから複雑で難解な質問を自動的に合成する戦略を提案する。
深層探索によるLLMの長距離推論を強化するために, エンドツーエンドのマルチターン強化学習を適用した。
論文 参考訳(メタデータ) (2025-09-12T17:52:35Z) - DeepSieve: Information Sieving via LLM-as-a-Knowledge-Router [57.28685457991806]
DeepSieveはエージェントRAGフレームワークで、LLM-as-a-knowledge-routerを介して情報を収集する。
我々の設計はモジュール性、透明性、適応性を重視しており、エージェントシステム設計の最近の進歩を活用している。
論文 参考訳(メタデータ) (2025-07-29T17:55:23Z) - Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design [35.544075583073685]
マルチターンRLアルゴリズムとエージェント応用のためのテキストターンレベルの報酬設計に関する最初の体系的研究について述べる。
我々は、多ターン推論強化検索エージェントのケーススタディを行い、検証可能とLCM-as-judgeの2種類のターンレベルの報酬を慎重に設計する。
マルチターン探索タスクの実験により、適切に設計されたターンレベルの報酬を組み込むことで、RLアルゴリズムは軌道レベルの報酬でベースライン法を大幅に上回ることを示す。
論文 参考訳(メタデータ) (2025-05-17T04:09:46Z) - Retrieve, Summarize, Plan: Advancing Multi-hop Question Answering with an Iterative Approach [6.549143816134531]
二重機能要約器を備えたReSPと呼ばれる新しい反復RAG法を提案する。
マルチホップ質問応答HotpotQAと2WikiMultihopQAの実験結果から,本手法が最先端技術よりも優れていることが示された。
論文 参考訳(メタデータ) (2024-07-18T02:19:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。