論文の概要: Traverse: Learning When to Remember, Reset, and Redirect for Long-Horizon Web Search
- arxiv url: http://arxiv.org/abs/2609.37082v1
- Date: Tue, 29 Sep 2026 09:13:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.355124
- Title: Traverse: Learning When to Remember, Reset, and Redirect for Long-Horizon Web Search
- Title(参考訳): Traverse: ロングホライズンWeb検索のための、いつ記憶し、リセットし、リダイレクトするかを学習する
- Abstract要約: エージェントが独自の検索プロセスを管理する自律型検索ハーネスを導入する。
エージェントはまず、有効な回答の基準を定義し、これらの基準の下で検索し、それから独立して結果を検証する。
さらに、アクティブなコンテキスト管理を可能にするシールメモリツールを備えている。
- 参考スコア(独自算出の注目度): 34.58308829379214
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon information-seeking agents often accumulate noisy or misleading context, causing early mistakes to persist and making recovery increasingly difficult. We introduce an autonomous search harness in which the agent manages its own search process through three states: Rubric, Answer, and Verify. The agent first defines criteria for a valid answer, searches under these criteria, and then independently verifies the result before deciding whether to terminate or continue searching. It is further equipped with a Seal Memory tool that enables active context management. Training this behavior with reinforcement learning, however, can induce Seal Collapse, resulting in unstable training and preventing the agent from reliably learning when and how to use its memory tools. We solve this with a simple strategy that trains only the final segment after context management. Our 35B model achieves 72.83 on BrowseComp, outperforming comparable open-source systems, and consistently improves over the base model across BrowseComp-ZH, xbench, DeepSearchQA, WideSearch, financial investigation, and product search. Ablations show that autonomous compression outperforms automatic compaction and validate our RL design.
- Abstract(参考訳): ロングホライゾン情報検索エージェントは、しばしばノイズや誤解を招くコンテキストを蓄積し、早期のミスを持続させ、回復を難しくする。
本稿では,エージェントがRubric,Answer,Verifyの3つの州を通じて,独自の検索プロセスを管理する自律検索ハーネスを提案する。
エージェントはまず、有効な回答の基準を定義し、これらの基準の下で検索し、その後、検索を終了するか継続するかを決定する前に独立して結果を検証する。
さらに、アクティブなコンテキスト管理を可能にするシールメモリツールを備えている。
しかし、強化学習を用いてこの行動を訓練することは、シール崩壊を誘発し、不安定な訓練をもたらし、エージェントがいつ、どのようにメモリツールを使うかを確実に学習するのを防ぐ。
コンテキスト管理後の最終セグメントのみをトレーニングするシンプルな戦略でこれを解決します。
私たちの35Bモデルは、BrowseCompで72.83を達成し、同等のオープンソースシステムより優れ、BrowseComp-ZH、xbench、DeepSearchQA、WideSearch、財務調査、製品検索でベースモデルよりも一貫して改善しています。
アブレーションにより、自律圧縮は自動圧縮よりも優れており、我々のRL設計を検証することができる。
関連論文リスト
- Breadcrumbing Search Agents [118.20284823674382]
LLMベースの検索エージェントは情報検索タスクに広く利用されているが、外部ツールへの依存度は重大なセキュリティリスクをもたらす。
検索およびページ観察を行うチャネルは脆弱なセキュリティ境界であることを示す。
制約付きツール仲介脅威モデルの下では、クエリ毎に1つのコントロールされた結果のみを追加することで、攻撃の成功を大幅に増加させることができる。
論文 参考訳(メタデータ) (2026-08-05T07:57:27Z) - AREX: Towards a Recursively Self-Improving Agent for Deep Research [75.96468303743958]
本稿では,再帰的自己改善型ディープリサーチエージェントであるAREXを紹介する。
AREXは、証拠を集め、暫定的な回答を構築する内部研究ループを交互に構成する。
我々は,エージェント学習と長期強化学習を通じて,AREXを検証済みの合成タスクと高品質な軌道上で訓練する。
論文 参考訳(メタデータ) (2026-07-23T16:05:46Z) - SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration [77.28003194268977]
SearchOSは、脆弱で暗黙的な検索進捗を明示的で永続的で共有状態に変換するシステムレベルのマルチエージェントフレームワークである。
SOCM上に構築されたSearchOSは、サブエージェントの実行を重複させるパイプライン並列スケジューリングメカニズムを適用している。
SearchOSは評価されたシングルエージェントとマルチエージェントのベースラインの中で、すべてのメトリクスをリードする。
論文 参考訳(メタデータ) (2026-07-16T17:51:23Z) - FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents [79.32220873172078]
ディープ・サーチ・エージェントの訓練には、十分な証拠が検索を通じて取得されるまで回答が得られない検証可能な質問が必要である。
このギャップをショートカット対応の難易度フレームワークで形式化し、4つの実行可能なショートカットリスクを特定する。
このフレームワークによってガイドされたFORTは、ショートカット耐性トレーニングデータ合成のフレームワークである。
論文 参考訳(メタデータ) (2026-06-10T13:49:11Z) - Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses [27.84773301655777]
本研究では,20B検索エージェント(検索サブエージェント)であるHarness-1を紹介する。
ハーネスは、候補プール、重要タグ付きキュレートセット、コンパクトエビデンスリンク、検証記録、圧縮および重複した観察を含む環境側のワーキングメモリを維持している。
8つのベンチマークで、Harness-1は平均0.730回のリコールを達成し、次の最強のオープンサーチサブエージェントを+11.4ポイント上回った。
論文 参考訳(メタデータ) (2026-06-01T15:21:41Z) - SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search [38.532946868233736]
エージェントサーチにより、LLMは反復推論と外部探索によって複雑なマルチホップ問題を解くことができる。
有効性にもかかわらず、これらのシステムは実際は限界に悩まされることが多い。
本稿では,探索行動を正確に制御し,精度を損なうことなく,動的自己認識を実現するための新しいRLフレームワークであるSAASを提案する。
論文 参考訳(メタデータ) (2026-05-28T11:45:45Z) - SE-Search: Self-Evolving Search Agent via Memory and Dense Reward [87.79131676521656]
Retrieval augmented generation (RAG)は、検索した外部知識を条件づけることにより、大規模言語モデル(LLM)における幻覚や事実エラーを低減する。
既存の手法は、無関係または騒々しい文書を蓄積し、希少な強化学習信号に依存することが多い。
我々は,3つのコンポーネントによるオンライン検索行動を改善するセルフ進化検索エージェントであるtextbfSelf-textbfEvolving textbfSearchを提案する。
論文 参考訳(メタデータ) (2026-02-06T09:14:07Z) - Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents [19.31471304268234]
DeSA(Decoupling Search-and-Answering)は,検索最適化と回答生成を明確に分離する単純な2段階トレーニングフレームワークである。
7つのQAベンチマークで、DeSAがトレーニングしたエージェントは検索の振る舞いを継続的に改善し、結果のみのベースラインよりも検索リコールと回答の精度が大幅に向上した。
論文 参考訳(メタデータ) (2025-10-06T11:09:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。