論文の概要: Reward-Free Evolving Agents via Pairwise Validator
- arxiv url: http://arxiv.org/abs/2607.14408v1
- Date: Wed, 15 Jul 2026 22:50:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.931761
- Title: Reward-Free Evolving Agents via Pairwise Validator
- Title(参考訳): Pairwise Validatorによる逆フリー進化剤
- Authors: Minghao Liu, Yu Wang, Jiayun Wang, Wei Wei,
- Abstract要約: 自己進化型エージェントループは、エージェントの微調整されたバージョンを何度も提案する。
項目ごとの品質信号に基づいて変更を受理または拒否する。
本稿では,アクセプション/リジェクトゲートのスカラーをペアワイズ検証器で置き換えることを提案する。
- 参考スコア(独自算出の注目度): 12.6053820984668
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A self-evolving agentic loop repeatedly proposes a tweaked version of an agent (its prompt template or program) and accepts or rejects the change based on a per-iteration quality signal. Designing that signal is often the costly part of the project: a reliable scalar reward requires domain expertise and labeled examples that are themselves as expensive to assemble as the agent's underlying task. We propose replacing the scalar at the accept/reject gate with a pairwise validator: a frozen LLM that, given the parent and child candidate, returns a binary verdict on which is better. Pairwise judgment is generally easier and more stable than absolute scoring, due to its contrastive nature, which mitigates the need for strict scale calibration. The validator also requires no training of its own. We integrate the validator into three published self-evolving engines (GEPA, ADRS, ShinkaEvolve) and report two flavors: Adaptive Focus, which retains the engine's existing val-set parent selection, and Soft Elo, which lets the validator's verdicts drive parent selection so that val-set rewards drop as well. Across multiple agents and two artifact substrates (prompt and code), our method matches or exceeds the full-reward baseline on the majority of settings we evaluate, and the pattern survives a cross-family validator swap. The pairwise gate is thus a drop-in replacement for per-step reward design at competitive task accuracy without the labeling cost.
- Abstract(参考訳): 自己進化型エージェントループは、エージェントの微調整されたバージョン(テンプレートやプログラムのプロンプト)を繰り返し提案し、その変更を設定ごとの品質信号に基づいて受け入れ、拒否する。
信頼できるスカラー報酬は、ドメインの専門知識と、エージェントの基本的なタスクとして組み立てるのにコストがかかるようなラベル付けされた例を必要とする。
本稿では,アクセプション/リジェクトゲートのスカラーをペアワイズ検証器に置き換えることを提案する。
ペアワイズ判定は、厳密なスケールキャリブレーションの必要性を緩和する対照的な性質のため、絶対的なスコアリングよりも一般的に簡単で安定である。
バリデータも独自のトレーニングは必要ありません。
検証を3つの自動進化エンジン(GEPA, ADRS, ShinkaEvolve)に統合し、エンジンの既存のval-set親選択を保持するAdaptive Focusと、検証者の判断が親選択を駆動してval-set報酬を減少させるSoft Eloという2つのフレーバーを報告します。
複数のエージェントと2つのアーティファクト基板(promptとcode)にまたがって、私たちのメソッドは評価したほとんどの設定において、フルリワードベースラインにマッチするか、超過します。
従って、ペアワイズゲートはラベリングコストを伴わずに、競合タスク精度でステップごとの報酬設計をドロップインで置き換える。
関連論文リスト
- TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection [0.0]
我々はLoRAをトレーニングデータ中毒によって確実にバックドアできることを示す。
攻撃はランクとともに単調にスケールし、選択されたトリガーアンカートークンはトリガー依存とベースモデル依存の両方である。
行動検出はサプライチェーンスキャンの操作可能な結果である。
論文 参考訳(メタデータ) (2026-05-28T16:32:25Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense [36.71358559780692]
HEROは、検証者信号と報酬モデルスコアを構造化された方法で統合する強化学習フレームワークである。
HEROはRMのみのベースラインと検証者のみのベースラインを一貫して上回り、検証可能なタスクと検証しにくいタスクの両方で大きな利益を上げている。
論文 参考訳(メタデータ) (2025-10-08T17:09:41Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。