論文の概要: Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds
- arxiv url: http://arxiv.org/abs/2608.02636v1
- Date: Fri, 31 Jul 2026 04:02:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.870962
- Title: Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds
- Title(参考訳): 自己進化型エージェントスキルの再考:複数ラウンドでのフィードバックダイナミクス
- Authors: Yuxuan Liu, Zhaochen Su, Yuhao Zhang, Jiahe Guo, Zhongwei Xie, Huihao Jing, Lingyun Xie, Qing Zong, Yauwai Yim, Zhixiong Zhang, Haoran Li, Yangqiu Song,
- Abstract要約: 自己進化型スキルシステムは、基礎となるモデルを変更することなく、実行フィードバックを永続的なスキル更新に変換することでエージェントを改善することを約束する。
5つのベンチマークと3つのモデルで制御された評価フレームワークを提案する。
全体として、永続的なスキルの自己進化は、モデル依存リターンとベンチマーク依存リターンを備えたスパース、バリデーションフィルタリング検索として理解されている。
- 参考スコア(独自算出の注目度): 43.5891705224868
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-evolving skill systems promise to improve agents by turning execution feedback into persistent skill updates without changing the underlying model. Yet it remains unclear when further evolution helps, how successful and failed trajectories shape revision, and whether extra test-time computation can recover the same gains. To address these questions, we present a controlled evaluation framework across five benchmarks and three models. Our primary study contains 42 feedback runs across 14 supported model-benchmark settings. Within each setting, we hold the executor and optimizer configuration, revision procedure, validation rule, and round budget fixed, while varying only the feedback shown to the optimizer: successes and failures (Normal), failures only, or successes only. Evolution is sparse: only 55 of 388 candidates establish byte-distinct validation bests. Validation-based selection chooses an evolved skill in 11 of 14 settings, nine of which improve released-test performance. All 11 selections come from feedback conditions that include failed trajectories, although the relative ranking of Normal and Fail-only varies across settings. Validation and downstream evaluations on test, robustness, and transfer sometimes favor different feedback views. A broader SearchQA analysis covering eight models shows similarly sparse, feedback-dependent dynamics. In the GPT-5.5 test-time-scaling controls, oracle Parallel Sampling comes within 0.43 points of the evolved SearchQA skill but remains 30.96 points behind on SpreadsheetBench; Sequential Refinement recovers neither gain. Overall, persistent skill self-evolution is better understood as sparse, validation-filtered search with model- and benchmark-dependent returns, rather than steady improvement from additional rounds. The implementation is available at https://github.com/HKUST-KnowComp/rethinkskill.
- Abstract(参考訳): 自己進化型スキルシステムは、基礎となるモデルを変更することなく、実行フィードバックを永続的なスキル更新に変換することでエージェントを改善することを約束する。
しかし、さらなる進化がいつ役立つか、軌道の形状の修正が成功し失敗したか、テストタイムの余分な計算が同じ利益を回復できるかは、まだ不明である。
これらの問題に対処するため、5つのベンチマークと3つのモデルにまたがる制御された評価フレームワークを提案する。
最初の調査では、14のモデルベンチマーク設定で42のフィードバックを実行しました。
各設定内では、エグゼキュータとオプティマイザの設定、修正手順、バリデーションルール、ラウンド予算の固定を保持しますが、オプティマイザに示されるフィードバックは、成功と失敗(Normal)、失敗のみ、成功のみです。
388人の候補者のうち55人だけがバイト別検証のベストを確立している。
バリデーションベースの選択は、14設定のうち11の進化したスキルを選択し、そのうち9つはリリーステストのパフォーマンスを改善している。
11のセレクションはすべて、軌道の失敗を含むフィードバック条件によるものだが、通常のものとフェイルのみの相対的なランクは設定によって異なる。
テスト、堅牢性、転送に関する検証と下流の評価は、時に異なるフィードバックビューを好む。
8つのモデルをカバーするより広範なサーチQA分析は、同様にスパースでフィードバックに依存したダイナミクスを示している。
GPT-5.5テストタイムスケーリングコントロールでは、オーラクルパラレルサンプリングは、進化したサーチQAスキルの0.43ポイント以内であるが、SpreadsheetBenchでは30.96ポイント遅れている。
全体として、永続的なスキルの自己進化は、追加のラウンドから着実に改善するのではなく、モデルとベンチマークに依存したリターンによるスパースで検証可能な検索として理解されている。
実装はhttps://github.com/HKUST-KnowComp/rethinkskillで公開されている。
関連論文リスト
- RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement [27.641105176473136]
既存のベンチマークは、最適化、サービス、評価、システム実装と研究上の決定を結びつける。
我々は、LLMエージェントのベンチマークであるRSIBench-Dataを、固定された後学習スタックを持つデータ中心の研究者として紹介する。
ソフトウェア工学,端末利用,科学的質問応答,数学の6つのベンチマークで,フロンティアエージェントを4つ評価した。
論文 参考訳(メタデータ) (2026-07-28T15:46:41Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - From Failing to Passing: Evolving Natural Language Prompt Optimization Rules for LLM Code Generation [11.454560846406698]
本稿では,自然言語変換ルールの集合を特定し,進化させる検索ベースアプローチを提案する。
次に、進化した変換ルールと実行フィードバックの修復を組み合わせた、段階的な修復パイプラインFIXを提案する。
以上の結果から,DualFixはベースライン障害の最大30%を回復し,SelfFixの3~5倍の障害を修正した。
論文 参考訳(メタデータ) (2026-07-06T14:10:56Z) - Regression Accumulation in Multi-Turn LLM Programming Conversations [25.94870617800846]
回帰累積は6つのモデルにまたがる
後続のコードが以前の要件と競合するクロスTurn Conflictは、主要な障害クラスである。
検証ゲートは、すべてのモデルを一貫して改善する唯一の戦略である。
論文 参考訳(メタデータ) (2026-07-02T08:15:40Z) - REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents [17.26555663132631]
GRASP(Gated Regression-Aware Skill Proposer)は、エージェントの改善を、境界付きスキルライブラリへの一連の編集として扱う。
臨床ベンチマークでは5つのベースモデルでGRASPを評価した。
論文 参考訳(メタデータ) (2026-05-28T09:30:09Z) - EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions [9.297494684604763]
EvoCode-Benchは26のステートフルコーディングタスクと227のラウンドのベンチマークである。
各タスクはエージェントのワークスペースを5~15ラウンド保存し、観測可能な振る舞いを通じて要求を記述する。
MT@4は4段階のフェールストップマルチラウンドスコアであり、SRは参照完了前の状態からのシングルラウンドスコアである。
論文 参考訳(メタデータ) (2026-05-22T18:17:28Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Test-time Recursive Thinking: Self-Improvement without External Feedback [120.80790108733942]
TRT(Test-time Recursive Thinking)は、反復的な自己改善フレームワークである。
オープンソースモデルはAIME-25/24で100%精度に達し、LiveCodeBenchの最も難しい問題では、クローズドソースモデルは外部からのフィードバックなしで10.4-14.8ポイント改善されている。
論文 参考訳(メタデータ) (2026-02-03T04:37:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。