論文の概要: SelfSearch: Reward-Free Search for Self-Improving Agents
- arxiv url: http://arxiv.org/abs/2609.37968v2
- Date: Wed, 30 Sep 2026 02:37:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.334314
- Title: SelfSearch: Reward-Free Search for Self-Improving Agents
- Title(参考訳): SelfSearch: Reward-free Search for Self-Improving Agents
- Abstract要約: 既存のアプローチでは、下流の繰り返しの評価を通じて改善されたエージェントを検索できる。
textbfSelfSearchは、前回の自己改善エピソードの記録を用いて、エージェントが自分自身を修正できる報酬のない検索手順である。
検索中にダウンストリームの報酬信号がないと、SelfSearchは6つのモデル(ベンチマーク設定)で初期エージェントよりも平均的な成功率を向上させる。
- 参考スコア(独自算出の注目度): 12.612647781309098
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Advances in the coding capabilities of LLM agents allow them to inspect and modify their own instructions, tools, and execution procedures. Existing approaches use this ability to search for improved agents through repeated downstream evaluation, which incurs substantial costs and ties the search to the evaluated tasks. We introduce \textbf{SelfSearch}, a reward-free search procedure in which agents modify themselves using records of previous self-improvement episodes. These records capture the reasoning, tool actions, and outcomes of earlier modification attempts, providing concrete experience for improving both task solving and self-modification. Without downstream reward signals during search, SelfSearch improves population-mean success over the initial agent in all six model--benchmark settings, with individual agents gaining up to 11.2 percentage points on Terminal-Bench 2.1. On SWE-bench Multilingual, an agent improves success by \textbf{5.0} percentage points while reducing execution cost by \textbf{38.5}\% on tasks solved by both the initial and evolved agents. SelfSearch achieves competitive task success with evaluation-guided search baselines at lower search cost. With only \textbf{\$4.03} in search cost, it produces a harness that solves \textbf{82.0}\% of Terminal-Bench 2.1 tasks with DeepSeek V4 Flash under the settings of a public nine-harness comparison, matching the top-scoring harness, Codex. These results suggest that experience gained through self-modification can improve agents' downstream capabilities and efficiency.
- Abstract(参考訳): LLMエージェントのコーディング能力の進歩により、独自の命令、ツール、実行手順の検査と修正が可能になる。
既存の手法では、下流の評価を繰り返して改善されたエージェントを探索する機能があり、それによってかなりのコストがかかり、評価されたタスクに関連付けられている。
本稿では,前回の自己改善エピソードの記録を用いて,エージェントが自分自身を修飾する報酬のない検索手順である「textbf{SelfSearch}」を紹介する。
これらの記録は、初期の修正の試みの推論、ツールアクション、成果を捉え、タスクの解決と自己修正の両方を改善するための具体的な経験を提供する。
検索中にダウンストリームの報酬信号がなければ、セルフサーチは6つのモデルベンチマーク設定で初期エージェントよりも平均的な成功率を高め、ターミナルベンチ2.1で最大11.2ポイントまで上昇する。
SWE-bench Multilingualでは、エージェントは、初期エージェントと進化エージェントの両方が解決したタスクに対して、実行コストを \textbf{38.5}\%削減しながら、 \textbf{5.0} のパーセンテージポイントで成功を改善する。
SelfSearchは,検索コストの低い評価誘導検索ベースラインで,競争力のあるタスクを成功させる。
検索コストは \textbf{\$4.03} のみであり、DeepSeek V4 Flash を用いて、9ハーネス比較の設定の下で、上位のハーネスである Codex と一致する、ターミナル-ベンチ2.1 タスクの \textbf{82.0}\% を解くハーネスを生成する。
これらの結果から, 自己修正により得られた経験は, エージェントの下流能力と効率を向上させることが示唆された。
関連論文リスト
- SearchMaster: Grounded and Regulated Self-Play for Search Agents [57.537666863340284]
検索エージェントの訓練には高品質な検索データが必要である。
既存のパイプラインは、人手によるタスクや専門家によるデモンストレーション、より強力な教師モデルに依存していることが多い。
本稿では,ローカル検索環境における検索タスクから,単一のLLMをトレーニングするセルフプレイフレームワークであるSearchMasterを提案する。
論文 参考訳(メタデータ) (2026-08-03T07:29:11Z) - AgentSearchBench: A Benchmark for AI Agent Search in the Wild [21.739444037726418]
本稿では,エージェント検索のための大規模ベンチマークであるAgentSearchBenchを紹介する。
このベンチマークは、エージェント検索を検索として形式化し、実行可能タスククエリと高レベルタスク記述の両方で問題を再分類する。
実行認識型探索を含む軽量な行動信号は、ランキング品質を大幅に向上させることができることを示す。
論文 参考訳(メタデータ) (2026-04-24T10:53:54Z) - CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search [51.911048955965136]
CoSearchは多段階推論エージェントと生成ドキュメントランキングモデルを共同でトレーニングするフレームワークである。
この結果から, 推論エージェントと検索システムの協調訓練は, 実現可能であり, 性能も高いことが示唆された。
論文 参考訳(メタデータ) (2026-04-19T17:48:17Z) - PRAISE: Prefix-Based Rollout Reuse in Agentic Search Training [28.912613644535668]
本稿では,エージェント検索訓練におけるデータ効率向上のためのフレームワークPRAISEを提案する。
本手法は,検索ポリシー学習とプレフィックス応答評価の両方に,単一の共有モデルを用いる。
マルチホップQAベンチマークの実験では、PRAISEは強いベースラインよりも一貫してパフォーマンスを改善している。
論文 参考訳(メタデータ) (2026-04-04T10:23:46Z) - SmartSearch: Process Reward-Guided Query Refinement for Search Agents [63.46067892354375]
大言語モデル(LLM)に基づく検索エージェントは、知識集約的な問題に対処するために有望であることが証明されている。
既存の研究は主に、検索エージェントの推論パラダイムの最適化に重点を置いているが、推論中の中間的な検索クエリの品質は見過ごされ続けている。
この問題を緩和する2つの主要なメカニズムの上に構築されたフレームワークであるSmartSearchを紹介します。
論文 参考訳(メタデータ) (2026-01-08T12:39:05Z) - Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents [19.31471304268234]
DeSA(Decoupling Search-and-Answering)は,検索最適化と回答生成を明確に分離する単純な2段階トレーニングフレームワークである。
7つのQAベンチマークで、DeSAがトレーニングしたエージェントは検索の振る舞いを継続的に改善し、結果のみのベースラインよりも検索リコールと回答の精度が大幅に向上した。
論文 参考訳(メタデータ) (2025-10-06T11:09:45Z) - Tree Search for Language Model Agents [73.97960454223164]
対話型Web環境での探索と多段階計画を行うために,LMエージェントの推論時探索アルゴリズムを提案する。
我々のアプローチは、実環境空間内で機能する最優先木探索の一形態である。
現実的なWebタスクにおいて有効性を示すLMエージェントのための最初の木探索アルゴリズムである。
論文 参考訳(メタデータ) (2024-07-01T17:07:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。