論文の概要: DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations
- arxiv url: http://arxiv.org/abs/2605.24539v1
- Date: Sat, 23 May 2026 12:10:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.173172
- Title: DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations
- Title(参考訳): DemoEvolve: デモによるエージェントハーネス進化におけるスパースフィードバックの克服
- Authors: Lirong Che, Yuzhe yang, Peiwen lin, Chuang wang, Xueqian wang, Jian su,
- Abstract要約: DemoEvolveは、進化を活用するためのデモブートストラップ付きのアプローチである。
我々はこのパラダイムを標本効率の速い適応の一形態として研究する。
DemoEvolveは、より効果的で監査可能なハーネス編集を生成する。
- 参考スコア(独自算出の注目度): 12.048713464721665
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent harness evolution improves frozen language-model agents by modifying the executable structures around them. We study this paradigm as a form of sample-efficient fast adaptation: instead of updating model weights, an agent can acquire task-specific competence by changing its external harness, while leaving the base model's general capabilities intact. Prior work shows that self-generated rollouts can support harness search, suggesting that agents may acquire new task competence through practice. Yet in long-horizon stochastic environments, self-practice becomes fragile: rewards are sparse, outcomes are high-variance, and failures are hard to attribute to concrete harness mechanisms. We introduce DemoEvolve, a demonstration-bootstrapped approach to harness evolution. When reward-only search is too broad and noisy, competent human trajectories serve as expert reference experience for the coding proposer, guiding harness-level diagnosis and editing. Experiments on Liar's Dice show that self-rollout evolution can work when episodes are short and failures are attributable. In contrast, Balatro exposes a harder long-horizon stochastic regime, where self-rollout evolution is misled by sparse feedback and candidate-selection noise, while tutorial-like textual knowledge alone does not yield stable improvement. Under the same limited budget, DemoEvolve produces more effective and auditable harness edits and achieves better performance. Overall, demonstrations make sparse-feedback harness evolution more diagnosable, localizable, and stable.
- Abstract(参考訳): エージェントハーネス進化は、周囲の実行可能な構造を変更することで、凍結した言語モデルエージェントを改善する。
モデル重みを更新する代わりに、エージェントは、ベースモデルの一般的な能力をそのまま残しながら、外部のハーネスを変更することでタスク固有の能力を得ることができる。
以前の研究は、自己生成ロールアウトがハーネス検索をサポートすることを示しており、エージェントが実践を通じて新しいタスク能力を獲得する可能性があることを示唆している。
しかし、長期の確率的環境においては、自己実践は脆弱になり、報酬はまばらになり、成果はばらつきが高く、失敗は具体的なハーネス機構に起因するのは難しい。
進化を活用するためのデモブートストラップ方式であるDemoEvolveを紹介する。
報酬のみの探索が広すぎてノイズの多い場合、有能な人間の軌道はコーディングプロジェクタのエキスパートリファレンス体験として機能し、ハーネスレベルの診断と編集を導く。
Liar's Diceの実験では、エピソードが短く失敗が原因で自己ロールアウトの進化が機能することを示した。
対照的に、バラトロはより厳しい長期の確率的体制を明らかにしており、自己ロールアウトの進化はスパースフィードバックと候補選択ノイズによって誤解されるが、チュートリアルのような文章知識だけでは安定した改善は得られない。
同じ予算で、DemoEvolveはより効果的で監査可能なハーネス編集を生成し、より良いパフォーマンスを実現している。
全体として、スパースフィードバックハーネスの進化はより診断可能で、ローカライズ可能で、安定している。
関連論文リスト
- Harnessing Agentic Evolution [32.567492765277855]
エージェント進化は、プログラム、イテレーション、科学的ソリューションを改善するための強力なパラダイムであり、候補を反復的に生成し、評価し、フィードバックを使って将来の探索を導く。
既存の手法は通常、モジュラーだが剛性のある固定手設計の手順や、フィードバックを柔軟に統合する汎用エージェントとしてインスタンス化される。
AEvoはメタエージェントがこの状態を観察し、次の候補を直接提案することでではなく、将来の進化を制御するプロシージャやエージェントコンテキストを編集することによって機能する。
論文 参考訳(メタデータ) (2026-05-13T17:45:16Z) - SEIF: Self-Evolving Reinforcement Learning for Instruction Following [53.280277743734096]
大規模言語モデル(LLM)の指示追従能力を高める自己進化型フレームワークSEIFを提案する。
SEIFは閉じた自己進化ループを形成し、モデルの命令追従能力を改善する。
複数のモデルスケールとアーキテクチャの実験により、SEIFは命令追従性能を一貫して改善し、強い汎用性を示唆している。
論文 参考訳(メタデータ) (2026-05-08T09:13:12Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - Self-Consolidation for Self-Evolving Agents [51.94826934403236]
大規模言語モデル(LLM)エージェントは静的システムとして機能し、生涯にわたる相互作用を通じて進化する能力に欠ける。
相補的進化機構を導入したLLMエージェントのための新しい自己進化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-02T11:16:07Z) - Guided Self-Evolving LLMs with Minimal Human Supervision [53.111086364268566]
無誘導の自己進化システムは、しばしば訓練として素早く、または劣化する。
R-Fewはガイド付きセルフプレイチャレンジャー(Self-Play Challenger)買収フレームワークで、コンテキスト内接地と混合トレーニングを通じて、軽量な人間の監視を取り入れている。
R-Fewは、数学と一般的な推論ベンチマークで一貫した反復的な改善を実現している。
論文 参考訳(メタデータ) (2025-12-02T07:06:11Z) - Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents [58.69865074060139]
エージェントの自己進化が意図しない方法で逸脱し、望ましくない結果や有害な結果に至る場合について検討する。
我々の経験から、誤進化は広範囲にわたるリスクであり、最上位のLSM上に構築されたエージェントにも影響を及ぼすことが判明した。
我々は、より安全で信頼性の高い自己進化型エージェントを構築するためのさらなる研究を促すための潜在的な緩和戦略について議論する。
論文 参考訳(メタデータ) (2025-09-30T14:55:55Z) - Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection [71.8243083897721]
視覚言語モデルは、しばしば詳細を幻覚させ、既存のオブジェクトを生成するか、出力信頼性を損なう不正確な属性を生成する。
本稿では、長文応答と短文応答の自己整合性を利用して、学習のための選好ペアを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T10:37:11Z) - LaMOuR: Leveraging Language Models for Out-of-Distribution Recovery in Reinforcement Learning [16.093659272414527]
本稿では,不確実性推定に頼らずに回復学習を可能にするLaMOuR(Language Models for Out-of-Distriion Recovery)を提案する。
LaMOuRは、エージェントを元のタスクを成功させる状態に誘導する高密度な報酬コードを生成する。
実験の結果,LaMOuRは様々な移動課題における回復効率を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2025-03-21T13:20:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。