論文の概要: DUET: Co-Evolving Solver and Grader Agents
- arxiv url: http://arxiv.org/abs/2610.04087v1
- Date: Fri, 02 Oct 2026 21:51:26 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:42:12.043092
- Title: DUET: Co-Evolving Solver and Grader Agents
- Title(参考訳): DUET: 溶媒とグレーダーエージェントの共進化
- Abstract要約: DUETは、ソルバエージェントとグレーダエージェントを共同で最適化し、両方を改善するフレームワークである。
最適化ループ内のグレーダを更新することにより、DUETはフィードバックの固定されたソースから評価を第一級最適化目標に変換する。
- 参考スコア(独自算出の注目度): 6.4831810395796765
- License:
- Abstract: Agentic workflows are increasingly used across domains such as technology, finance, and enterprise operations. As these agents become more widely deployed, continually improving them becomes increasingly important. This raises an immediate challenge: How should the agent evolve? This evolution requires effective evaluation that can assess outcomes and provide useful feedback for optimization. As the agent evolves, its behaviors and failure modes may also change, making a fixed evaluator increasingly inadequate. Another fundamental question: How should we evaluate an evolving agent? These two challenges are inherently coupled; changes in agent behavior can expose limitations of the current evaluator, while a stronger evaluator provides more informative feedback for improving the agent. Motivated by this interaction, we introduce DUET, a framework that jointly optimizes a solver agent and a grader agent to improve both. DUET iteratively selects training tasks, executes them with the solver, evaluates the resulting outcomes with the grader, and uses a tool-using update module to revise the solver and the grader, alternating between the two across rounds. By updating the grader within the optimization loop, DUET turns evaluation from a fixed source of feedback into a first-class optimization objective that adapts alongside the solver. Experiments across four agent benchmarks show that DUET improves both solver and grader performance and consistently outperforms baselines that optimize the solver with a fixed grader.
- Abstract(参考訳): エージェントワークフローは、テクノロジ、ファイナンス、エンタープライズオペレーションといった分野にまたがって使われるようになっている。
これらのエージェントがより広くデプロイされるにつれて、継続的な改善がますます重要になる。
エージェントはどのように進化すべきか?
この進化には、成果を評価し、最適化に有用なフィードバックを提供する効果的な評価が必要である。
エージェントが進化するにつれて、その動作や障害モードも変化し、固定評価器がますます不十分になる。
もう一つの根本的な疑問:進化するエージェントをどのように評価するか?
これら2つの課題は本質的に結合しており、エージェントの振る舞いの変化は現在の評価者の限界を露呈し、より強い評価者はエージェントを改善するためにより有益なフィードバックを提供する。
この相互作用に動機づけられたDUETは,ソルバエージェントとグレーダエージェントを協調的に最適化し,両者を改良するフレームワークである。
DUETは、トレーニングタスクを反復的に選択し、ソルバで実行し、その結果をグレーダで評価し、ツール使用更新モジュールを使用して、ソルバとグレーダを修正し、ラウンド毎に2つを交互に切り替える。
最適化ループ内のグレーダを更新することにより、DUETは、固定されたフィードバック源からの評価を、ソルバとともに適応する第一級最適化目標に変換する。
4つのエージェントベンチマークでの実験では、DUETはソルバとグレーダの両方のパフォーマンスを改善し、固定グレーダでソルバを最適化するベースラインを一貫して上回っている。
関連論文リスト
- CAFE: Self-Improving Search Agents Need Co-Evolving Feedback [64.5257526832476]
アウトカム管理された検索エージェントは、いつ、どのように証拠を回収するかを学習するが、端末の報酬は中間エラーのローカライズも、それらのエラーが複雑になる前に継続する軌道のリダイレクトもしない。
学習した軌道内での介入として修正的フィードバックを扱うことは、エージェントがいつフィードバックを要求し使用するかを決めなければならないのに対し、批評家は、エージェントが改善するにつれて障害パターンが変化する結果構築されたロールアウトから有用な修正を推測しなければならない。
論文 参考訳(メタデータ) (2026-08-25T16:39:00Z) - The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - VeRO: An Evaluation Harness for Agents to Optimize Agents [5.227525836910522]
我々は、バージョン管理されたエージェントスナップショット、予算管理された評価、構造化された実行トレースを備えた再現可能な評価手法であるVERO(Versioning, Rewards, Observations)を紹介する。
本研究では,ターゲットエージェントの比較実験を行い,どの修正がターゲットエージェントの性能を確実に向上させるか分析する。
論文 参考訳(メタデータ) (2026-02-25T23:40:22Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - SE-Agent: Self-Evolution Trajectory Optimization in Multi-Step Reasoning with LLM-Based Agents [32.76299758137446]
大規模言語モデル(LLM)ベースのエージェントは、最近、複雑な推論とツールの使用において、環境とのマルチステップのインタラクションを通じて印象的な機能を示した。
これらの軌道にはリッチなフィードバックが含まれており、エージェントを正しい方向に誘導して問題を正しく解くことができる。
モンテカルロ木探索 (MCTS) のような一般的な手法は、探索と搾取を効果的にバランスさせることができるが、それらは様々な軌道間の相互依存を無視している。
エージェントが推論プロセスを反復的に最適化できる自己進化フレームワークSE-Agentを提案する。
論文 参考訳(メタデータ) (2025-08-04T05:51:55Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。