論文の概要: PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- arxiv url: http://arxiv.org/abs/2608.26530v1
- Date: Thu, 27 Aug 2026 02:06:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.214543
- Title: PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- Title(参考訳): PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- Abstract要約: ロングホライゾンエージェントは、現在の実行と将来の作業の両方を改善することができるエクスペリエンスを生成する。
私たちは、アクティブな実行をリダイレクトし、永続的なハーネスを更新するために、新たなエクスペリエンスを使用することで、自己改善は実際に行うべきだ、と論じています。
PILOTは2つの複合メカニズムによるライブ自己改善のためのスーパーバイザ・ワーカーハーネスである。
- 参考スコア(独自算出の注目度): 23.54605486688848
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon agent runs generate experience that can improve both the current run and future work. Most self-improvement methods process this experience only after execution ends, so they cannot redirect the active run or immediately apply and validate lessons learned from it. We argue that self-improvement should instead be live, using emerging experience both to redirect the active run and to update the persistent harness. Existing agent architectures do not fully support this goal. Single-agent self-correction combines task execution and trajectory assessment within one context, while subagent delegation separates execution but typically cannot redirect an active subagent. We present PILOT, a supervisor-worker harness for live self-improvement through two coupled mechanisms: (1) live steering lets a separate supervisor redirect or abort the active worker during execution; and (2) live self-evolution distils procedures and failure modes revealed during execution into reusable skills and memory. Across two frozen backbones and three benchmarks, PILOT ranks first in five of six configurations. On Terminal-Bench 2.0, PILOT outperforms counterpart harnesses by up to 9.8 percentage points. In the self-improvement setting, PILOT gains 14.6 points with GLM-5.1 and 12.4 points with Kimi-K2.6. Mean output tokens fall by 42.9% and 47.4%, while successful evaluations per million output tokens rise by 110.3% and 134.0%, respectively.
- Abstract(参考訳): ロングホライゾンエージェントは、現在の実行と将来の作業の両方を改善することができるエクスペリエンスを生成する。
ほとんどの自己改善メソッドは実行終了後にのみこのエクスペリエンスを処理するため、アクティブな実行をリダイレクトしたり、すぐに適用したり、そこから学んだ教訓を検証したりすることはできない。
私たちは、アクティブな実行をリダイレクトし、永続的なハーネスを更新するために、新たなエクスペリエンスを使用することで、自己改善は実際に行うべきだ、と論じています。
既存のエージェントアーキテクチャはこの目標を完全にはサポートしていない。
単一エージェントの自己補正はタスク実行とトラジェクトリアセスメントをひとつのコンテキスト内で組み合わせ、サブエージェントのデリゲーションは実行を分離するが、通常はアクティブなサブエージェントをリダイレクトすることができない。
PILOT は,(1) 作業中に個別の作業員をリダイレクトまたは中止させるライブステアリング,(2) 実行中に明らかにされた手順や障害モードを再利用可能なスキルや記憶に活用する,という2つのメカニズムによるライブ自己改善のためのスーパーバイザハーネスである。
2つの冷凍バックボーンと3つのベンチマークで、PILOTは6つの構成のうち5つにランクインしている。
ターミナル・ベンチ2.0では、PILOTは相手のハーネスを9.8ポイント上回っている。
自己改善設定では、PILOTはGLM-5.1で14.6点、Kim-K2.6で12.4点を獲得した。
平均出力トークンは42.9%、47.4%減少し、100万当たりの出力トークンの評価は110.3%、134.0%上昇した。
関連論文リスト
- Closing the Consistency Gap: Self-Evolving Agents That Learn to Stay on Course [5.9756241643216255]
LLM(Large Language Model)によるエージェントは、平均的には正確だが、プロダクションでは信頼性が低い。
本稿では,エージェント・トラジェクトリにおける不安定で低一貫性のステップを特定することで,このギャップを小さくする自己進化型フレームワークを提案する。
AppWorld with ReAct/GPT-4.1では、同じタスクの評価で+16点、類似タスクの一般化で+13点の5つの実行で成功するタスクの比率を上げています。
論文 参考訳(メタデータ) (2026-09-08T14:53:43Z) - HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? [61.02699867449589]
評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
論文 参考訳(メタデータ) (2026-09-01T15:45:33Z) - EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents [56.25120535601186]
視覚言語アクション(VLA)モデルは、視覚観察と言語指示を直接ロボットアクションにマッピングする。
本稿では,各スキル決定を実行提案として扱うフレームワークであるEmbodiedSkillsを提案する。
共有可能スキルインタフェースは、ハイレベルスキル選択、バウンドローレベルVLA実行、ポストアクション検証を接続する。
論文 参考訳(メタデータ) (2026-09-01T14:14:47Z) - Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback [52.78692582507693]
専門家による自然言語スキルは、ツール使用エージェントを改善することができるが、エージェントによるスキルは、スキルを使用しないよりも8-11ポイント悪い。
本研究では,中間的スキルから実行経験を訓練状態に整理する方法について検討する。
論文 参考訳(メタデータ) (2026-08-18T09:52:48Z) - Recursive Synthesis for Long-Horizon Terminal Tasks [50.39352383646813]
Recursive Synthetic Terminal Tasks (RST) は、大規模に長期の端末エージェントタスクを構築するためのフレームワークである。
RSTは37,484個の合成端末エージェントタスクを1タスクあたり0.05ドルで生成する。
軌道の微調整により、Qwen3.5-27BとQwen3.5-122B-A10Bはターミナルベンチ2、ターミナルベンチハード、ロングホライゾンターミナルベンチで最大10ポイント改善される。
論文 参考訳(メタデータ) (2026-08-05T23:24:26Z) - Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories [41.919231699460944]
Harness-R1は、既存の実行ランタイムのエラー条件付きライフサイクルワイドな編集を学習機能を提供する最初の方法です。
オンラインの強化学習を専門とするハーネスエンジニアをポストトレーニングし、その編集は、彼らが実現したタスク成功のために最適化される。
WebShop、ALFWorld、DBBenchの他、Harness-R1はバニラQwen3.5-9Bを44.3%から53.6%に引き上げている。
論文 参考訳(メタデータ) (2026-08-03T14:12:18Z) - Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning [17.169000876264796]
高レベルの意思決定を通じて効果的な実行を復元するエージェント強化学習フレームワークを提案する。
実行時劣化下では、ロボットが以前訪れた名目状態に回復するための適切な回復メカニズムをトリガーする。
提案手法をLIBEROベンチマークで評価し,最大13.7%の精度向上を実現した。
論文 参考訳(メタデータ) (2026-07-15T13:25:52Z) - APEX: Adaptive Principle EXtraction A Three-Layer Self-Evolution Framework for Production AI Agents [0.0]
AIエージェントの自己改善は、重要な研究フロンティアとして現れている。
同時に進化する3層共進化フレームワークであるAPEXを提案する。
その結果,多次元共進化は単一軸ハーネス最適化を著しく上回ることがわかった。
論文 参考訳(メタデータ) (2026-06-13T15:47:27Z) - SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows [16.693609667845948]
SKILL.nbは,エビデンス・リバース・キャリブレーションによるライフサイクルポリシーによる再利用可能なエージェント管理のためのフレームワークである。
SKILL.nbは選択的な形式化を使用する: 実行はどのワークフローステップを実行可能なコードにするかを決定する。
ゲート条件付き実行では、各ステップがゲートの検証時にコードを実行したり、ドリフトが実行可能実現を無効にした場合にローカルにフォールバックすることが可能になる。
論文 参考訳(メタデータ) (2026-06-06T08:27:18Z) - Shepherd: A Runtime Substrate Empowering Meta-Agents with a Formalized Execution Trace [37.66254228361724]
ターゲットエージェントのメタエージェント操作を関数として形式化する関数型プログラミングモデルであるShepherdを紹介する。
Shepherdは、すべてのエージェントと環境のインタラクションをGitライクな実行トレースの型付きイベントとして記録し、過去の状態をフォークして再生することができる。
このシステムは、エージェントプロセスと、Dockerよりも5ドル高速にフォークし、リプレイ時のプロンプトキャッシュの再利用を95%以上達成している。
論文 参考訳(メタデータ) (2026-05-11T17:50:51Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience [56.50613398808361]
本稿では,新しい2段階自己進化型モバイルGUIエージェントを提案する。
最初の段階では、完全に自律的なループでデータとモデルの継続的な共進化を可能にするRejection Fine-Tuning (RFT) を採用しています。
第2段階はグループ相対自己蒸留(GRSD)を導入し、グループロールアウトにおける重要なフォークポイントを特定し、成功軌道から失敗軌道の修正に至るまで、密度の高いステップレベルの監視を構築する。
論文 参考訳(メタデータ) (2026-03-25T17:10:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。