論文の概要: Learning from Research: Toward Lifelong Agent Harness Evolution
- arxiv url: http://arxiv.org/abs/2609.40169v1
- Date: Wed, 30 Sep 2026 17:00:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.118613
- Title: Learning from Research: Toward Lifelong Agent Harness Evolution
- Title(参考訳): 研究から学ぶ:生涯エージェントのハーネス進化に向けて
- Abstract要約: 言語エージェントはますます複雑なタスクを解決することが期待されている。
有望なアプローチの1つは、ツールの使用、メモリ管理、タスク実行を管理するソフトウェアであるエージェントハーネスを進化させることである。
ScholarEvolveは、進化をガイドするための最先端の研究を自動的に引き出すフレームワークである。
- 参考スコア(独自算出の注目度): 25.703133924514884
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language agents are expected to solve increasingly complex tasks, creating a growing need for continual improvement. One promising approach is to evolve the agent harness, the software that governs tool use, memory management, and task execution, while keeping the underlying language model fixed. Recent methods automate this process by using a meta coding agent to modify the harness based on execution feedback. However, relying on that agent's existing knowledge and observed failures can restrict exploration and make adaptation reactive. Inspired by how human experts learn from the research literature for new solutions, we introduce ScholarEvolve, a framework that automatically draws on state-of-the-art research to guide harness evolution. ScholarEvolve organizes the harness evolution directions into functional modules and uses topic modeling to identify distinct improvement strategies for each module. It implements these strategies and evaluates their combinations to improve task performance. Moreover, the framework is designed to incorporate new publications over time, allowing research advances to drive proactive lifelong evolution. Experiments demonstrate improvements on AppWorld and Tau2-Bench. ScholarEvolve raises Qwen3.5-27B task goal completion from 49.6% to 63.6% on AppWorld Challenge, and raises GPT-5.4-mini pass@1 from 72.7% to 81.9% on Tau2-Bench Telecom.
- Abstract(参考訳): 言語エージェントはますます複雑なタスクを解決し、継続的な改善の必要性が高まると予想されている。
1つの有望なアプローチは、ツールの使用、メモリ管理、タスク実行を管理するソフトウェアであるエージェントハーネスを進化させ、基礎となる言語モデルを修正し続けることである。
最近の手法では、メタコーディングエージェントを使用して、実行フィードバックに基づいてハーネスを変更することで、このプロセスを自動化する。
しかし、エージェントの既存の知識と観察された失敗に頼れば、探索を制限し、適応を反応性を持たせることができる。
人間の専門家が新しいソリューションの研究文献からどのように学ぶかに触発されて、私たちはScholarEvolveを紹介した。
ScholarEvolveは、ハーネスの進化方向を機能モジュールに整理し、トピックモデリングを使用して各モジュールの異なる改善戦略を特定する。
これらの戦略を実装し、それらの組み合わせを評価し、タスクのパフォーマンスを向上させる。
さらに、このフレームワークは、新たな出版物を時間をかけて組み込むように設計されており、研究の進歩により、活動的な寿命の進化を促進することができる。
実験では、AppWorldとTau2-Benchの改善が示されている。
ScholarEvolveはAppWorld ChallengeでQwen3.5-27Bタスク目標を49.6%から63.6%に引き上げ、Tau2-Bench TelecomでGPT-5.4-mini pass@1を72.7%から81.9%に引き上げている。
関連論文リスト
- Recursive self-improvement of AI research agents [18.181986898488983]
本稿では,AI研究エージェントの研究効率向上のためのループを実装するシステムであるAIDE2を提案する。
8日間の自律走行で、AIDE2は、新しい検索ポリシーからメモリメカニズムまで、連続した7つの改善点を発見した。
最強の発見エージェントは、FML-Benchで最強のランクにランクインした、人間工学による製造研究エージェントと一致または超えている。
論文 参考訳(メタデータ) (2026-09-22T14:12:13Z) - MLEvolve: A Self-Evolving Framework for Automated Machine Learning Algorithm Discovery [36.12600393708582]
大規模言語モデル(LLM)エージェントは、科学的な発見や機械学習工学のような長期的タスクにますます応用されている。
エンド・ツー・エンドの機械学習アルゴリズム発見のための,LLMベースの自己進化型マルチエージェントフレームワークであるMLEvolveを提案する。
論文 参考訳(メタデータ) (2026-06-04T17:55:59Z) - CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery [67.47220507982522]
大規模言語モデル(LLM)ベースの進化は、オープンな発見のための有望なアプローチである。
オープンエンド問題における自律的マルチエージェント進化のための最初のフレームワークであるCORALを紹介する。
コーラルは、厳格な制御を長期にわたるエージェントに置き換え、探索し、反射し、協力する。
論文 参考訳(メタデータ) (2026-04-02T05:59:06Z) - EvoScientist: Towards Multi-Agent Evolving AI Scientists for End-to-End Scientific Discovery [18.348102991427965]
EvoScientistは進化するマルチエージェントAI科学者フレームワークである。
永続記憶と自己進化を通じて研究戦略を継続的に改善する。
科学的なアイデア生成において、7つのオープンソースおよび商用の最先端システムを上回っている。
論文 参考訳(メタデータ) (2026-03-09T09:07:19Z) - SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning [83.98129545309277]
生経験と政策改善のギャップを埋めるフレームワークであるSkillRLを提案する。
本手法では,階層型スキルライブラリであるSkillBankを構築するために,経験に基づく蒸留機構を導入する。
ALF、WebShop、および7つの検索強化タスクの実験結果は、SkillRLが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-09T03:17:17Z) - A Survey of Self-Evolving Agents: On Path to Artificial Super Intelligence [87.08051686357206]
大きな言語モデル(LLM)は強力な能力を示しているが、基本的に静的である。
LLMはますますオープンでインタラクティブな環境にデプロイされているため、この静的な性質は重要なボトルネックとなっている。
この調査は、自己進化エージェントの体系的で包括的なレビューを初めて提供する。
論文 参考訳(メタデータ) (2025-07-28T17:59:05Z) - EvolveSearch: An Iterative Self-Evolving Search Agent [98.18686493123785]
大規模言語モデル(LLM)は、検索エンジンやWebブラウザなどのツールを統合することで、エージェント情報検索機能を変革した。
本研究では,SFTとRLを組み合わせた新たな反復的自己進化フレームワークであるEvolveSearchを提案する。
論文 参考訳(メタデータ) (2025-05-28T15:50:48Z) - CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark [11.794931453828974]
CORE-Benchは3つの分野(コンピュータ科学、社会科学、医学)にわたる90の科学論文に基づく270のタスクからなるベンチマークである。
エージェントの精度を高速かつ並列に測定する評価システムを提案する。
最高のエージェントは、最も難しいタスクにおいて21%の精度を達成した。
論文 参考訳(メタデータ) (2024-09-17T17:13:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。