論文の概要: AREX: Towards a Recursively Self-Improving Agent for Deep Research
- arxiv url: http://arxiv.org/abs/2607.21461v2
- Date: Fri, 24 Jul 2026 03:34:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:31.043245
- Title: AREX: Towards a Recursively Self-Improving Agent for Deep Research
- Title(参考訳): AREX: 深層研究のための再帰的自己改善剤を目指して
- Abstract要約: 本稿では,再帰的自己改善型ディープリサーチエージェントであるAREXを紹介する。
AREXは、証拠を集め、暫定的な回答を構築する内部研究ループを交互に構成する。
我々は,エージェント学習と長期強化学習を通じて,AREXを検証済みの合成タスクと高品質な軌道上で訓練する。
- 参考スコア(独自算出の注目度): 75.96468303743958
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep research requires agents to find answers that jointly satisfy multiple constraints. Discovering such answers is costly, whereas verifying a candidate can often be decomposed into tractable constraint-wise checks. This discovery--verification asymmetry suggests that a research agent should do more than simply search longer: it should recursively improve its current answer by verifying intermediate results and using the partially verified state to guide subsequent refinement. We introduce AREX, a family of Recursively Self-Improving (RSI) deep research agents. AREX alternates between an inner research loop that gathers evidence and constructs a provisional answer, and an outer self-improvement loop that audits the answer constraint-wise, identifies unresolved claims, and launches targeted follow-up research. To sustain RSI over long horizons, AREX learns an autonomous context-update tool that compresses growing interaction history into a compact improvement state preserving verified evidence and unresolved constraints, without relying on an external model. We train AREX on verified synthetic tasks and high-quality trajectories through agentic mid-training and long-horizon reinforcement learning. To mitigate sparse final rewards during long horizon learning, we emphasize key steps where decisive evidence is acquired or erroneous research directions are corrected. We instantiate a dense 4B model and a 122B-A10B Mixture-of-Experts model. Across BrowseComp, WideSearch, DeepSearchQA, Humanity's Last Exam (HLE), and other reasoning and tool-use benchmarks, AREX substantially outperforms comparable-scale baselines and remains competitive with models using substantially more activated parameters.
- Abstract(参考訳): ディープリサーチでは、エージェントは複数の制約を共同で満たす答えを見つける必要がある。
このような解答の発見にはコストがかかるが、候補の検証は、しばしばトラクタブルな制約ワイズチェックに分解される。
この発見-検証非対称性は、研究エージェントが単に検索以上のことをすべきであることを示唆している。中間結果を検証し、部分的に検証された状態を使用してその後の改善を導くことで、現在の回答を再帰的に改善すべきである。
本稿では,Recursively Self-Improving (RSI) Deep Research AgentのファミリーであるAREXを紹介する。
AREXは、証拠を収集して暫定的な回答を構築する内部研究ループと、回答を制約的に監査し、未解決のクレームを識別し、目標とするフォローアップリサーチをローンチする外部自己改善ループとを交互に行う。
長期にわたってRSIを維持するために、AREXは、増大する相互作用履歴を、外部モデルに頼ることなく、検証済みの証拠と未解決の制約を保存するコンパクトな改善状態に圧縮する、自律的なコンテキスト更新ツールを学習した。
我々は,エージェント学習と長期強化学習を通じて,AREXを検証済みの合成タスクと高品質な軌道上で訓練する。
長期水平学習における最終報酬の減少を軽減するため,決定的な証拠が得られたり,誤った研究方向が修正されたりする重要なステップを強調した。
我々は、高密度な4Bモデルと122B-A10BのMixture-of-Expertsモデルをインスタンス化する。
Across BrowseComp, WideSearch, DeepSearchQA, Humanity's Last Exam (HLE) その他の推論およびツール使用ベンチマークでは、AREXは同等のスケールのベースラインを著しく上回り、さらにアクティベートされたパラメータを使用したモデルと競合し続けている。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks [6.001213285107465]
AutoResearchEvalは、7つの科学領域にまたがるフロンティア科学に根ざした100のタスクを特徴としている。
8つのハーネスモデルの組み合わせを評価すると、800個のオート検索剤の軌道が得られる。
我々は,人間のキャリブレーションしたエージェント・アズ・ア・ジャッジ・パイプラインを利用して,完全な軌道や中間成果物を検査する。
論文 参考訳(メタデータ) (2026-08-14T21:39:38Z) - R$^2$-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search [59.034878430183305]
R$2$-Searcherは、検索と推論の境界を明示的に探索し、校正する。
R$2$-Searcherは,解答精度と検索品質において,最先端のエージェント検索法よりも優れていることを示す。
論文 参考訳(メタデータ) (2026-06-26T19:44:34Z) - SubSearch: Intermediate Rewards for Unsupervised Guided Reasoning in Complex Retrieval [61.73547199231695]
SubSearchは、結果のみの監視から中間報酬信号に移行する特殊なフレームワークである。
実験により、本質的な報酬を伴う中間的推論ステップの報酬はより堅牢な推論トレースをもたらすことが示された。
SubSearchは、複雑なクエリ応答のための検索エンジンをよりよく統合できる推論トレースを構築するのに役立つ。
論文 参考訳(メタデータ) (2026-04-08T13:09:47Z) - SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search Agent [39.43590030917357]
SIGHTは、セルフエビデンスサポートと情報ゲイン駆動のディバースブランチを通じて、検索ベースの推論を強化するフレームワークである。
SIGHTは、検索結果をSESを介して高忠実性証拠に蒸留し、インフォメーションゲインスコアを算出して、重要な状態を特定する。
シングルホップとマルチホップのQAベンチマークの実験では、SIGHTが既存のアプローチを大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2026-02-12T04:16:55Z) - Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards [60.0970117192627]
強化学習(Reinforcement Learning, RL)は, LLMに基づくディープサーチエージェントの強化に重要な手法である。
既存のアプローチは主にバイナリ結果の報酬に依存しており、エージェントの推論プロセスの包括性と事実性を捉えていない。
ディープサーチエージェントのための微粒化報酬フレームワークである textbfCitation-aware RL Rewards (CaRR) を提案する。
論文 参考訳(メタデータ) (2026-01-09T18:57:53Z) - Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search [56.78490647843876]
エージェント検索は、大規模言語モデル(LLM)が推論とツールの使用をインターリーブできるようにすることによって、複雑な情報を探すための有望なパラダイムとして登場した。
本稿では,bfM-ASKを提案する。bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK,bfM-ASK。
論文 参考訳(メタデータ) (2026-01-08T08:13:27Z) - RE-Searcher: Robust Agentic Search with Goal-oriented Planning and Self-reflection [55.125987985864896]
環境の複雑さが脆弱な探索行動をいかに引き起こすかを定量的に分析する。
本稿では,検索エージェントRE-Searcherのインスタンス化をシンプルかつ効果的に行う手法を提案する。
この目標指向計画と自己回帰の組み合わせにより、RE-Searcherは複雑な検索環境における急激な手がかりに抵抗することができる。
論文 参考訳(メタデータ) (2025-09-30T10:25:27Z) - Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning [35.35813310224967]
大きな言語モデルは印象的な推論能力を示してきたが、本質的には知識貯水池によって制限されている。
Retrieval-augmented reasoningは、LCMが外部リソースをクエリできるようにすることによって、この制限を緩和する。
本稿では,新しい「探索・復調思考」パラダイムを取り入れた強化学習フレームワークであるAutoRefineを提案する。
論文 参考訳(メタデータ) (2025-05-16T14:11:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。