論文の概要: TeleTune: Evolving Agent Skills From Offline Telemetry
- arxiv url: http://arxiv.org/abs/2610.05437v2
- Date: Tue, 06 Oct 2026 03:17:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.373968
- Title: TeleTune: Evolving Agent Skills From Offline Telemetry
- Title(参考訳): TeleTune:オフラインテレメトリによるエージェントスキルの進化
- Abstract要約: オフラインログからスキルライブラリを学ぶためのフレームワークであるTeleTuneを紹介した。
TeleTuneは、ログされたトラジェクトリ上でアクション予測エラーを使用して、ライブラリの編集を提案し、ホールドアウトアクション予測精度を改善するものだけを保持する。
テスト時には、エージェントは学習ライブラリとワークフローベースの検索デモが提供される。
- 参考スコア(独自算出の注目度): 95.35252240800817
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Computer-use agents need to capture procedural knowledge of how people use software. User telemetry offers a scalable source of this knowledge. However, learning reusable skills from these logs requires addressing three challenges: (1) Goal Underspecification, since logs do not record the goal behind each action; (2) Non-Replayability, since past activity cannot be replayed to evaluate skill updates; and (3) Interleaved Trajectories, since logs may mix several tasks without marking their boundaries. To address these, we introduce TeleTune, a framework for learning a textual skill library from offline logs without recorded goals, cannot be replayed during optimization, and may interleave tasks. TeleTune uses action-prediction errors on logged trajectories to propose library edits and keep only those that improve held-out action-prediction accuracy, which we call skill-guided progress. The learned workflows also enable retrieval of demonstrations that cover the subgoals of a new task. At test time, the agent is provided with the learned library and the workflow-based retrieved demonstrations. Experiments on WorkArena and Online-Mind2Web show that TeleTune outperforms random retrieval, Agent Workflow Memory (AWM), and their combination. We find that the best baseline varies by setting, whereas TeleTune achieves average success rates of 77.1% and 80.6%, respectively, improving over the strongest baseline on each benchmark by 6.7% and 7.7%. Under the heaviest perturbation of the WorkArena training data,TeleTune keeps the highest average success rate at 68.5%, 6.3% above the strongest baseline. Our analyses show (1) skill optimization and workflow-based retrieval are complementary, (2) optimizing on fixed logs costs 5 to 75 times fewer tokens than validating the same edits with live episodes, (3) skill-guided progress tracks the live success rate.
- Abstract(参考訳): コンピュータ利用エージェントは、人々がソフトウェアを使う方法に関する手続き的な知識を捉える必要がある。
ユーザテレメトリは、この知識のスケーラブルなソースを提供します。
しかし,これらのログから再利用可能なスキルを学ぶためには,(1)目標不特定性,ログがそれぞれのアクションの背後にある目標を記録できないこと,(2)過去の活動がスキル更新を評価するために再生できないこと,(3)ログが境界をマークせずに複数のタスクを混在する可能性があること,の3つの課題に対処する必要がある。
このような問題に対処するために,オフラインログからテキストスキルライブラリを学習するフレームワークであるTeleTuneを導入する。
TeleTuneは、ログ化されたトラジェクトリ上でアクション予測エラーを使用して、ライブラリの編集を提案し、保持されたアクション予測精度を改善するものだけを保持します。
学習したワークフローは、新しいタスクのサブゴールをカバーするデモの検索も可能にする。
テスト時には、エージェントは学習ライブラリとワークフローベースの検索デモが提供される。
WorkArenaとOnline-Mind2Webの実験によると、TeleTuneはランダム検索、AWM(Agent Workflow Memory)、およびそれらの組み合わせよりも優れている。
最良基準は設定によって異なるが、TeleTuneは平均成功率77.1%と80.6%を達成し、各ベンチマークにおける最強基準を6.7%と7.7%に改善している。
ワークアリーナのトレーニングデータの急激な摂動の下では、テレトゥーンは最強のベースラインより6.3%高い68.5%の最高成功率を維持している。
分析の結果,(1) スキル最適化とワークフローに基づく検索は相補的であり,(2) 固定ログの最適化は,生のエピソードで同じ編集を検証した場合の5~75倍のトークンコストであり,(3) スキルガイドによる進歩は生の成功率を追跡することがわかった。
関連論文リスト
- RideWay: Benchmarking Efficient Task Completion for Tool-Using Language Agents [2.0159253466233222]
RideWayは、ステートフルなツールコール環境における配車エージェントのための効率中心のベンチマークである。
効率性 ユーティリティは、タスク固有の参照作業に対して、過剰なツールコールとユーザ向きのターンに対して、成功したトラジェクトリを割引する。
タスク不一致の保留条件では、効率ユーティリティは全体の78.7%の精度を達成している。
論文 参考訳(メタデータ) (2026-09-16T01:15:21Z) - Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback [52.78692582507693]
専門家による自然言語スキルは、ツール使用エージェントを改善することができるが、エージェントによるスキルは、スキルを使用しないよりも8-11ポイント悪い。
本研究では,中間的スキルから実行経験を訓練状態に整理する方法について検討する。
論文 参考訳(メタデータ) (2026-08-18T09:52:48Z) - TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents [22.01777615106231]
Long-Horizon Large Language Model (LLM) エージェントは通常、スパース終端結果に最適化される。
本稿では、ステップレベルの監督を行動誘発遷移から直接引き出すトランジッションワイド・クレジット・アサインメントを提案する。
ALFWorld、WebShop、および7つの検索拡張された質問回答ベンチマークの実験は、評価されたベースラインよりも一貫した改善を示している。
論文 参考訳(メタデータ) (2026-08-17T06:19:12Z) - Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training [52.78248352851176]
強化学習(Reinforcement Learning, RL)は、大規模言語モデルにおける推論能力を引き出すための訓練後のパラダイムである。
本研究では,この残差軸をタスク学習可能性として検討する。
そこで我々はTrajValを提案する。TrajValは、短いプローブランと2つのエンドポイント評価からタスク毎の学習可能性を近似する軽量なプローブベース推定器である。
論文 参考訳(メタデータ) (2026-08-10T07:43:05Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall [19.839833440257813]
本稿では、継続的に更新された体験プールから、きめ細かなステップワイズ検索を行うステップワイド体験リコールを提案する。
ToolQAベンチマークで評価すると、SEERは難しい質問では6.1%、難しい質問では4.7%の平均的な改善を達成している。
Qwen2.5-7BとQwen2.5-72Bのモデルにより、SEERはそれぞれ7.44%と23.38%の精度向上を示した。
論文 参考訳(メタデータ) (2025-08-21T03:56:38Z) - Benchmarking Neural Network Training Algorithms [52.890134877995195]
トレーニングアルゴリズムは、ディープラーニングパイプラインに不可欠な部分です。
コミュニティとして、トレーニングアルゴリズムの改善を確実に特定することはできない。
固定ハードウェア上で実行される複数のワークロードを使用した,新たな,競争力のある,時間と時間のベンチマークを導入する。
論文 参考訳(メタデータ) (2023-06-12T15:21:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。