論文の概要: Dr. Free: You Don't Need Difficulty Rewards for Self-Evolving Search Agents
- arxiv url: http://arxiv.org/abs/2609.33565v1
- Date: Sun, 27 Sep 2026 13:37:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 15:43:05.952147
- Title: Dr. Free: You Don't Need Difficulty Rewards for Self-Evolving Search Agents
- Title(参考訳): Dr. Free: 自己進化型検索エージェントには難解なリワードは必要ない
- Abstract要約: Methodnameは、難易度に基づく提案者報酬を排除する最初の自己進化型検索フレームワークである。
7つのオープンドメインQAベンチマークの実験では、Dr. Freeはデータフリーの検索エージェントよりも優れていた。
- 参考スコア(独自算出の注目度): 42.89010881177449
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A central limitation of current data-free self-evolution methods for training search agents is their reliance on difficulty-based proposer rewards. These methods reward a proposer for generating questions that challenge a co-evolving solver, using solver difficulty as a proxy for question quality. Yet difficulty alone is insufficient to distinguish questions that require cross-passage evidence from those that are answerable via simpler shortcuts. In addition, measuring difficulty demands repeated solver rollouts for every candidate question, leading to substantial computational costs. In this paper, we introduce \methodname, the first self-evolving search framework that eliminates difficulty-based proposer rewards and directly optimizes for evidence necessity relative to shortcut contexts. Dr. Free samples relational chains from a knowledge graph and pairs them with aligned passages, giving question generation an explicit multi-hop structure. A generated question receives a positive information-gain reward only when the likelihood of the target answer under the complete evidence passages exceeds the maximum likelihood under all evaluated shortcut contexts. Because this signal is computed from teacher-forced likelihoods, it removes the need for pass-rate estimation and reduces proposer training time by over $7\times$. Experiments on seven open-domain QA benchmarks show that Dr. Free outperforms prior data-free search agents and the supervised baseline, with large improvements on multi-hop QA benchmarks.
- Abstract(参考訳): 検索エージェントを訓練するための現在のデータフリーな自己進化法の中心的な制限は、難易度に基づく提案者報酬に依存することである。
これらの手法は、問題解決に挑戦する質問を生成するための提案者に対して、問題解決の難しさを質問品質のプロキシとして活用する。
しかし、単純なショートカットで答えられるものとは、クロスパスの証拠を必要とする質問を区別するのは難しい。
さらに,難易度測定には各質問に対する繰り返しの解答のロールアウトが必要であり,計算コストの大幅な増大につながった。
本稿では,難易度に基づく提案者の報酬を排除し,ショートカットの文脈に対して必要な証拠を直接最適化する,最初の自己進化型検索フレームワークである‘methodname’を紹介する。
フリー博士は知識グラフからリレーショナルチェインをサンプリングし、それらを整列通路と組み合わせ、質問生成を明示的なマルチホップ構造にする。
生成された質問は、すべての評価されたショートカットコンテキストにおいて、完全なエビデンスパスにおける対象回答の確率が最大値を超える場合にのみ、肯定的な情報ゲイン報酬を受け取る。
このシグナルは教師が強制する確率から計算されるため、パスレート推定の必要性を排除し、プロポーサのトレーニング時間を7ドル以上削減する。
7つのオープンドメインQAベンチマークの実験では、Dr. Freeは、マルチホップQAベンチマークを大幅に改善し、事前のデータフリー検索エージェントと教師付きベースラインを上回っている。
関連論文リスト
- Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula [0.0]
自己進化的推論フレームワークは、チャレンジャーに、解決者の弱点を明らかにする質問を生成するように訓練する。
既存のアプローチでは、チャレンジャーの報酬として1つのソルバのサンプリングの不確実性を用いる。
モデル容量とサンプリング温度に異なる異種アンサンブルを用いたマルチソルバ不一致報酬を提案する。
論文 参考訳(メタデータ) (2026-08-30T20:49:16Z) - Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents [21.366388027090736]
自己進化型検索エージェントは、独自の検索タスクを生成し、解決する。
探索セルフプレイ(SSP)フレームワーク上に構築し,多段階探索と推論による質問の生成と回答を行う。
本稿では,知識グラフの経路を,質問構築と報酬形成の中間管理として利用することで,二つのボトルネックに対処する。
論文 参考訳(メタデータ) (2026-05-07T05:46:53Z) - SubSearch: Intermediate Rewards for Unsupervised Guided Reasoning in Complex Retrieval [61.73547199231695]
SubSearchは、結果のみの監視から中間報酬信号に移行する特殊なフレームワークである。
実験により、本質的な報酬を伴う中間的推論ステップの報酬はより堅牢な推論トレースをもたらすことが示された。
SubSearchは、複雑なクエリ応答のための検索エンジンをよりよく統合できる推論トレースを構築するのに役立つ。
論文 参考訳(メタデータ) (2026-04-08T13:09:47Z) - Inferential Question Answering [67.54465021408724]
新しいタスクであるInferential QAを導入します。これは、答えをサポートするパスから答えを推測するためにモデルに挑戦するものです。
そこで本研究では,7,401問と2.4M節からなるQUITデータセットを構築した。
我々は,従来のQAタスクに有効な手法が推論QAに苦しむことを示し,レトリバーは性能が低下し,リランカーは利得が制限され,微調整は不整合の改善をもたらすことを示した。
論文 参考訳(メタデータ) (2026-02-01T14:02:43Z) - SAGE: Steerable Agentic Data Generation for Deep Search with Execution Feedback [68.60326181052658]
本稿では,高品質で難易度の高い探索問合せを自動生成するエージェントパイプラインを提案する。
我々のパイプラインであるSAGEは、QAペアを提案するデータジェネレータと、生成された質問を解決するための検索エージェントで構成される。
我々の本質的な評価は、SAGEが様々な推論戦略を必要とする質問を生成する一方で、生成したデータの正確性や難易度を著しく高めていることを示している。
論文 参考訳(メタデータ) (2026-01-26T06:37:56Z) - Dr. Zero: Self-Evolving Search Agents without Training Data [34.91191770652202]
我々は,検索エージェントがトレーニングデータなしで効果的に自己開発できるフレームワークであるDr. Zeroを紹介した。
特に,提案者が多様な質問を生成する自己進化フィードバックループを設計し,同じベースモデルから問題解決者を訓練する。
トレーニング効率を向上させるため、ホップ群相対ポリシー最適化(HRPO)も導入する。
論文 参考訳(メタデータ) (2026-01-11T20:27:55Z) - BMGQ: A Bottom-up Method for Generating Complex Multi-hop Reasoning Questions from Semi-structured Data [8.52473384574856]
本稿では,半構造化知識ソースから高難易度,訓練可能なマルチホップ質問を自動生成するフレームワークを提案する。
このシステムは、自然言語推論(NLI)に基づく関係型付けと多様性を意識した拡張を通じて、多様な、論理的にラベル付けされたエビデンスクラスタを成長させる。
論文 参考訳(メタデータ) (2025-10-28T07:43:15Z) - UQ: Assessing Language Models on Unsolved Questions [149.46593270027697]
当社では,Stack Exchangeから提供された500の難解で多様な質問を対象としたテストベッドであるUQを紹介します。
未解決の質問は、人間が答えを求めるときにしばしば難しく自然に発生する。
上位モデルは15%の質問でUQ検証をパスし、予備的な人間の検証はすでに正しい答えを同定している。
論文 参考訳(メタデータ) (2025-08-25T01:07:59Z) - DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs [9.561022942046279]
大規模言語モデル(LLM)の推論能力を高めるため,DCR(Divide and Conquer Reasoning)を提案する。
まず、信頼性スコア(mathcalCS$)に基づいて質問を2つのサブセットに分類する。
特に,質問を信頼性スコア(mathcalCS$)に基づいて2つのサブセットに分類する。
論文 参考訳(メタデータ) (2024-01-10T14:38:46Z) - Adapting Neural Link Predictors for Data-Efficient Complex Query
Answering [45.961111441411084]
本稿では,複雑な問合せタスクに対して,ニューラルネットワーク予測スコアを再校正するために最適化されたパラメータ効率のスコア強調モデルを提案する。
CQD$mathcalA$は現在の最先端手法よりもはるかに正確な結果が得られる。
論文 参考訳(メタデータ) (2023-01-29T00:17:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。