論文の概要: Aspire: Can Models Self-Evolve from Vague Goals?
- arxiv url: http://arxiv.org/abs/2608.31111v1
- Date: Mon, 31 Aug 2026 17:14:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.537324
- Title: Aspire: Can Models Self-Evolve from Vague Goals?
- Title(参考訳): Aspire: Vagueのゴールから自己進化をモデル化できるか?
- Authors: Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei, Junting Zhou, Zexuan Wang, Yuchen Wu, Huan Zhou, Duo Wang, Yinzhu Piao, Yongchang Peng, Yunfeng Shi, Jin Chen, Zuo Wang, Jinkai Liu, Jiaheng Liu, Wenxuan Zhang, Shen Yan, Wenhao Huang, Ge Zhang,
- Abstract要約: 我々はあいまいなゴール駆動型自己進化のベンチマークであるASPIREを紹介する。
ASPIREは、統一された対話環境におけるモデルウェイトとエージェントハーネスの進化をサポートする。
実験の結果,曖昧な目標が探索努力を目標解釈に向けることが示唆された。
- 参考スコア(独自算出の注目度): 61.65007006747275
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Many important forms of human learning begin with a vague goal, such as "become a better physicist" or "improve at research." Learners must interpret the goal, identify capability gaps, decide how to learn, and determine whether they have actually improved. In contrast, existing work on LLM self-evolution typically begins with tasks and evaluation metrics specified by humans, reducing self-evolution to optimizing an explicit objective rather than deciding what and how to learn. We introduce ASPIRE, a benchmark for vague-goal-driven self-evolution. ASPIRE provides only a natural-language capability goal while downstream evaluation tasks remain hidden. The agent must operationalize the goal by choosing data and update methods, constructing training and validation signals, and deciding when to evaluate. ASPIRE supports both model-weight and agent-harness evolution in a unified interactive environment and evaluates the resulting systems on a hidden, expert-authored set of 520 items spanning six goals. Our experiments show that vague goals redirect search effort toward goal interpretation. Current agents routinely complete training and harness-editing loops, but weight-level gains remain sparse and unstable, and the strongest evolved harness remains below the engineered Qwen-Agent reference. Agents often train on mismatched data and trust narrow self-evaluations, so local gains fail to transfer to hidden evaluation and continued search and training can erase earlier improvements.
- Abstract(参考訳): 人間の学習の多くの重要な形態は、「より良い物理学者になる」とか「研究の進歩」といった曖昧な目標から始まる。
学習者は目標を解釈し、能力ギャップを特定し、学習方法を決定し、実際に改善したかどうかを判断しなければならない。
対照的に、LLMの自己進化に関する既存の研究は、一般的には、人間が指定したタスクと評価指標から始まり、自己進化を減らし、何とどのように学習するかを決定するのではなく、明確な目的を最適化する。
我々はあいまいなゴール駆動型自己進化のベンチマークであるASPIREを紹介する。
ASPIREは、下流評価タスクが隠されている間、自然言語機能目標のみを提供する。
エージェントは、データの選択とメソッドの更新、トレーニングと検証信号の構築、評価のタイミングの決定によって目標を運用する必要がある。
ASPIREは、統一された対話環境におけるモデルウェイトとエージェントハーネスの進化をサポートし、6つの目標にまたがる520項目の隠蔽された専門家が認可したセット上で、結果のシステムを評価する。
実験の結果,曖昧な目標が探索努力を目標解釈に向けることが示唆された。
現在のエージェントは定期的な訓練とハーネス・エジットのループを完備するが、重量レベルのゲインは狭く不安定であり、最強の進化したハーネスはクウェン=アジェント(英語版)の基準の下にある。
エージェントはしばしばミスマッチしたデータでトレーニングし、狭い自己評価を信頼する。
関連論文リスト
- Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - Unsupervised Learning of Efficient Exploration: Pre-training Adaptive Policies via Self-Imposed Goals [0.0]
教師なし事前学習は、強化学習エージェントに事前知識を付与し、下流タスクでの学習を加速することができる。
本稿では,文脈内学習者と対向目標生成戦略を組み合わせた教師なしメタ学習手法ULEEを提案する。
論文 参考訳(メタデータ) (2026-01-27T17:10:29Z) - Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning [52.99434388759101]
ツール統合推論による継続的改善を実現する自己進化型視覚言語エージェントを提案する。
Agent0-VLは、ツールの使用法を推論だけでなく、自己評価や自己修復にも取り入れている。
実験の結果,Agent0-VLはベースモデルよりも12.5%向上していることがわかった。
論文 参考訳(メタデータ) (2025-11-25T04:15:14Z) - Consistent Zero-Shot Imitation with Contrastive Goal Inference [30.726311787096435]
現実世界のインタラクションに展開されるエンボディエージェントの前提条件は、インタラクションによるトレーニングであるべきだ。
本研究の主な貢献は,対話型エージェントを自己指導型で事前学習する方法である。
論文 参考訳(メタデータ) (2025-10-20T00:28:03Z) - SELF: Self-Evolution with Language Feedback [68.6673019284853]
SELF(Self-Evolution with Language Feedback)は、大規模言語モデルを進化させる新しいアプローチである。
LLMは、人間の学習プロセスと同様、自己回帰を通じて自己改善を可能にする。
数学および一般タスクにおける実験により,SELFは人間の介入なしにLLMの能力を高めることができることが示された。
論文 参考訳(メタデータ) (2023-10-01T00:52:24Z) - Automatic Curriculum Learning through Value Disagreement [95.19299356298876]
新しい未解決タスクを継続的に解決することが、多様な行動を学ぶための鍵です。
エージェントが複数の目標を達成する必要があるマルチタスク領域では、トレーニング目標の選択はサンプル効率に大きな影響を与える可能性がある。
そこで我々は,エージェントが解決すべき目標のための自動カリキュラムを作成することを提案する。
提案手法は,13のマルチゴールロボットタスクと5つのナビゲーションタスクにまたがって評価し,現在の最先端手法よりも高い性能を示す。
論文 参考訳(メタデータ) (2020-06-17T03:58:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。