論文の概要: From Interaction Traces to Persistent Skills: Online Evolution for Computer-Use Agents
- arxiv url: http://arxiv.org/abs/2609.04869v1
- Date: Fri, 04 Sep 2026 08:29:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.97549
- Title: From Interaction Traces to Persistent Skills: Online Evolution for Computer-Use Agents
- Title(参考訳): インタラクショントレースから永続的スキルへ:コンピュータ利用エージェントのオンライン進化
- Abstract要約: 本稿では,インタラクショントラジェクトリと評価器フィードバックを再利用手順の永続的でバージョン管理されたライブラリに変換するオンラインスキル進化フレームワークを提案する。
我々は、OSWorldの4つのアプリケーションドメインにまたがって、完全に進化するライブラリシステムと、設定にマッチした空のライブラリ制御を比較した。
GIMPでは、プロファイランス・アウェア・アナリティクスにより、タスク・オブ・オリジンの境界を越えた検索とリビジョンが示され、繰り返し受け入れられた編集が元のタスクの回復に失敗する。
- 参考スコア(独自算出の注目度): 48.50635499112162
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Computer-use agents can execute increasingly complex tasks in graphical interfaces, but their interaction experience is typically transient: procedural knowledge acquired from one rollout is not systematically retained, refined, and reused in later tasks. Existing skill libraries provide external procedural knowledge, yet their incremental value over the same agent operating without skills, as well as their longitudinal dynamics under repeated interaction, remain insufficiently characterized. We present an online skill-evolution framework that converts interaction trajectories and evaluator feedback into a persistent, versioned library of reusable procedures. Each iteration executes against a frozen library snapshot, and evidence-guided skill updates become available in subsequent iterations without changing model parameters. We compare the full evolving-library system with a configuration-matched empty-library control across four OSWorld application domains under the same fixed action-generation and GUI-grounding stack, task sets, and iteration horizons. Following a five-iteration empty-library warm-up, Full attains a higher post-warm-up mean evaluator score in all four observed domain runs, with mean differences ranging from 5.7 to 18.6 percentage points and domain-dependent temporal stability. In GIMP, provenance-aware analysis reveals retrieval across task-of-origin boundaries and revision churn, where repeated accepted edits fail to recover the originating task. These findings characterize evolving skill libraries as auditable, shared procedural memory that can improve a fixed computer-use stack, while showing that their benefits are conditional and repeated revision does not guarantee recovery. Code is released at https://github.com/LongtaoHu/Skill-Evo4GUI.
- Abstract(参考訳): コンピュータ利用エージェントはグラフィカルインタフェースでますます複雑なタスクを実行することができるが、その相互作用体験は典型的には過渡的であり、あるロールアウトから得られた手続き的知識は体系的に保持されず、洗練され、後続のタスクで再利用される。
既存の技術ライブラリーは、外部の手続き的知識を提供するが、スキルを持たない同じエージェントに対して漸進的な価値を提供する。
本稿では,インタラクショントラジェクトリと評価器フィードバックを再利用手順の永続的でバージョン管理されたライブラリに変換するオンラインスキル進化フレームワークを提案する。
各イテレーションは凍結したライブラリスナップショットに対して実行され、モデルパラメータを変更することなく、エビデンス誘導されたスキル更新がその後のイテレーションで利用可能になる。
我々は,4つのOSWorldアプリケーションドメインにまたがる構成に整合した空ライブラリ制御を,同じ固定アクション生成およびGUIグラウンドスタック,タスクセット,イテレーションの地平線の下で比較する。
5項目の空のウォームアップの後、Fullは観測された4つの領域全てにおいて、平均平均評価値が高く、平均差は5.7から18.6ポイント、ドメインに依存した時間安定性である。
GIMPでは、プロファイランス・アウェア分析により、タスク・オブ・オリジン境界とリビジョン・チャーンをまたいだ検索が行われ、繰り返し受け入れられた編集が元のタスクの回復に失敗する。
これらの知見は、進化するスキルライブラリを、修正されたコンピュータ使用スタックを改善するための監査可能な共有プロシージャメモリとして特徴付けるとともに、それらの利点が条件付きであり、繰り返し修正が回復を保証しないことを示す。
コードはhttps://github.com/LongtaoHu/Skill-Evo4GUIで公開されている。
関連論文リスト
- SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams [55.90739575113059]
再利用の欠如は、関連するタスクのクラスタによって共有される解決手順であり、その周りでSkillGLoWを構築している、と我々は主張する。
4つのベンチマーク(数学的推論、端末の自動化、ソフトウェア修復、実施制御)と3つのモデルで、前者は平均17.2ポイント(ハード)を獲得している。
論文 参考訳(メタデータ) (2026-09-02T07:31:18Z) - SCAFFOLD: Self-Improving Web Agents via Recursive Parametric Skill Abstraction [13.7368753473801]
textscScaffoldはビジュアルWebエージェントのための自己改善フレームワークである。
マルチインスタンス抽象制約の下で、成功した軌道からパラメトリックで実行可能なスキルを誘導する。
textscScaffoldは、最強のスキル強化ベースラインよりも11.1$--17.2$の絶対ポイントで成功率を改善する。
論文 参考訳(メタデータ) (2026-08-31T08:16:56Z) - ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - From Cognitive Architectures to Language Agents: A Mechanism-Level Review of Lineage, Convergence, and Migration Gaps [0.0]
レビューでは、10の歴史的認知アーキテクチャ、8つの言語エージェントランタイムファミリ、42のメカニズムにフォーカスしたモダンなシステムを関連付けている。
状態、制御、移行、永続化、失敗、学習、リソースガバナンスを通じて、各メカニズムを再構築します。
我々は、独特なメカニズムカタログ、監査可能なエビデンス深さフレームワーク、そしてこれらのバンドルを構成可能な不変量としてテストするための偽りのアジェンダを貢献する。
論文 参考訳(メタデータ) (2026-07-27T02:38:59Z) - Beyond Domains: Reusing Web Skills via Transferable Interaction Patterns [68.0603867264595]
SkillMigratorは再利用可能なWebスキルを学習し、特定の要素参照ではなくレイアウト構造にマッチしてサイト間でそれらを転送する。
WebArenaとMind2Webの両方において、成功軌道上の平均LCM-アクション数を、一致した成功速度で8-10%削減する。
論文 参考訳(メタデータ) (2026-06-16T08:04:35Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills [31.23929961213889]
大規模言語モデル(LLM)エージェントは、現実世界のタスクを解きながら豊富なエピソード軌道を蓄積する。
SkillEvolBenchは、経験の再利用からスキル形成まで、このステップを評価するための診断ベンチマークである。
現在のエージェントは、しばしばローカルに適応するが、堅牢な再利用可能なスキルを形成することは滅多にない。
論文 参考訳(メタデータ) (2026-05-22T18:23:31Z) - REVERE: Reflective Evolving Research Engineer for Scientific Workflows [44.36828076189902]
既存のプロンプト最適化技術は、動作を更新するための局所的な信号に依存しており、多くの場合、タスク全体にわたってパターンが繰り返され、一般化が貧弱になる。
我々は,グローバルトレーニングコンテキストから継続的に学習するフレームワークであるReflective Evolving Research Engineer (REVERE)を紹介する。
REVEREは、この反射的最適化フレームワークを通じて、SUPERの4.50%、ResearchCodeBenchの3.51%、ScienceAgentBenchの4.89%で、最先端の専門家による研究コーディングタスクの命令よりもパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2026-03-21T05:58:30Z) - AutoAgent: Evolving Cognition and Elastic Memory Orchestration for Adaptive Agents [26.380991138110925]
AutoAgentは、認知の進化、オンザフライでのコンテキスト決定、弾力性のあるメモリオーケストレーションに基づく、自己進化型のマルチエージェントフレームワークである。
各エージェントは、ツール、自己能力、同僚の専門知識、タスク知識に関する構造化されたプロンプトレベルの認知を維持する。
AutoAgentは、静的およびメモリ拡張ベースラインに対するタスク成功、ツール使用効率、共同ロバスト性を一貫して改善する。
論文 参考訳(メタデータ) (2026-03-10T14:23:49Z) - SWE-Bench-CL: Continual Learning for Coding Agents [0.0]
SWE-Bench-CLは、人間検証されたSWE-Bench検証データセット上に構築された、新しい連続学習ベンチマークである。
GitHubのイシューを、自然リポジトリの進化を反映した時系列順序に整理することで、SWE-Bench-CLは、エージェントのエクスペリエンスを蓄積する能力を直接評価できる。
論文 参考訳(メタデータ) (2025-06-13T07:11:14Z) - CLIN: A Continually Learning Language Agent for Rapid Task Adaptation
and Generalization [62.0397906276669]
CLINは、複数のトライアルを継続的に改善した最初の言語ベースのエージェントである。
ゼロショットのパフォーマンスを4ポイント改善し(新しいタスクでは13)、連続的なメモリ更新によってパフォーマンスをさらに向上させることができる。
これは、凍結モデル上に構築されたエージェントのための新しいアーキテクチャを示唆している。
論文 参考訳(メタデータ) (2023-10-16T07:17:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。